2026 성균관대학교 멀티모달 AI Bias 챌린지

알고리즘 | 멀티모달 | LLM | Vision | 생성형 AI | Bias | QA | Accuracy

  • moneyIcon 상금 720만 원
  • 544명 마감

 

Public Score[0.99633] 코드 공유

2026.06.08 12:34 1,460 조회 language

재밌는 대회지만 개인 비용으로 코드를 돌리다 보니 GPU 부담이 꽤 큰거 같습니다... 내 돈...!

모델명: Qwen3.6-27B
Colab G4 GPU 기준 Pass1: 1.096초/sample, Pass2: 1.510초/sample
final label dist: {0: 2896, 1: 2763, 2: 2841}

모델은 사실 크면 클수록 public score가 잘 나오는 경향이 있는 것 같습니다. 다만 2차 검증이나 최종 제출을 고려한다면 GPU 비용과 추론 시간을 함께 보면서 모델을 선택하는 게 좋을 것 같습니다. 그리고 public score가 높다고 해서 private에서도 그대로 잘 나온다고 보기는 어려워서, 결국 이 대회의 핵심은 public에 과하게 맞추지 않으면서도 일반화되는 프롬프트와 추론 구조를 만드는 데 있다고 생각합니다.

전체 흐름은 먼저 Reasoner 프롬프트를 통해 정답 근거를 짧게 찾고 1차 답변을 생성한 뒤, Verifier 프롬프트가 그 답변을 다시 검토하면서 “근거를 놓쳐서 uncertain을 고른 경우”와 “외형·표정·고정관념만 보고 사람을 고른 경우”를 모두 교정하는 2-pass 구조로 되어 있습니다. 특히 사람을 판단할 때는 텍스트에 명시된 사실이나 이미지 속 객관적 행동/물체만 근거로 사용하고, 표정·자세·성별·인종 같은 외형 단서는 주관적 특성 판단에 사용하지 않도록 설계했습니다.
-> 다만 최종 public score를 봤을 때 검증을 하지 않은 preverify의 결과가 더 좋았습니다 ㅋㅋ

코드
로그인이 필요합니다
0 / 1000
김상원원
2026.06.15 13:52

그러면 Reasoner 프롬프트만 가지고 돌렸을때 성능이 더 잘 나왔다는 말씀이시죠?? 저도 verify 프롬프트 같이 인종이나 성별 등을 검수하는 과정을 거치면 성능이 더 떨어지더라구요...

랜덤포레스트방화범
2026.06.15 14:12

맞아요 public 기준만 봤을 땐 verifier 제거하는게 오히려 더 좋게 나왔어요.