분석시각화 대회 코드 공유 게시물은
내용 확인 후
좋아요(투표) 가능합니다.
Public Score[0.99633] 코드 공유
재밌는 대회지만 개인 비용으로 코드를 돌리다 보니 GPU 부담이 꽤 큰거 같습니다... 내 돈...!
모델명: Qwen3.6-27B
Colab G4 GPU 기준 Pass1: 1.096초/sample, Pass2: 1.510초/sample
final label dist: {0: 2896, 1: 2763, 2: 2841}
모델은 사실 크면 클수록 public score가 잘 나오는 경향이 있는 것 같습니다. 다만 2차 검증이나 최종 제출을 고려한다면 GPU 비용과 추론 시간을 함께 보면서 모델을 선택하는 게 좋을 것 같습니다. 그리고 public score가 높다고 해서 private에서도 그대로 잘 나온다고 보기는 어려워서, 결국 이 대회의 핵심은 public에 과하게 맞추지 않으면서도 일반화되는 프롬프트와 추론 구조를 만드는 데 있다고 생각합니다.
전체 흐름은 먼저 Reasoner 프롬프트를 통해 정답 근거를 짧게 찾고 1차 답변을 생성한 뒤, Verifier 프롬프트가 그 답변을 다시 검토하면서 “근거를 놓쳐서 uncertain을 고른 경우”와 “외형·표정·고정관념만 보고 사람을 고른 경우”를 모두 교정하는 2-pass 구조로 되어 있습니다. 특히 사람을 판단할 때는 텍스트에 명시된 사실이나 이미지 속 객관적 행동/물체만 근거로 사용하고, 표정·자세·성별·인종 같은 외형 단서는 주관적 특성 판단에 사용하지 않도록 설계했습니다.
-> 다만 최종 public score를 봤을 때 검증을 하지 않은 preverify의 결과가 더 좋았습니다 ㅋㅋ
맞아요 public 기준만 봤을 땐 verifier 제거하는게 오히려 더 좋게 나왔어요.
DACON Co.,Ltd | CEO Kookjin Kim | 699-81-01021
Mail-order-sales Registration Number: 2021-서울영등포-1704
Business Providing Employment Information Number: J1204020250004
#901, Eunhaeng-ro 3, Yeongdeungpo-gu, Seoul 07237
E-mail dacon@dacon.io |
Tel. 070-4102-0545
Copyright ⓒ DACON Co.,Ltd All rights reserved
그러면 Reasoner 프롬프트만 가지고 돌렸을때 성능이 더 잘 나왔다는 말씀이시죠?? 저도 verify 프롬프트 같이 인종이나 성별 등을 검수하는 과정을 거치면 성능이 더 떨어지더라구요...