Obfuscated Korean Review Restoration and Generative AI Competition

Algorithm | Montly Dacon | NLP | Generate AI | LLM | F1 Score

  • moneyIcon DASCHOOL Pro Subscription
  • 825 Users Completed

 

[Private 3위] 음절 단위 커스텀 토크나이저 + 다층 BiLSTM

공동작성자

stroke
2025.03.04 00:12 2,375 Views language

이번 대회에서는 입출력 데이터를 변형한 다양한 증강 기법을 적용하여 성능 향상을 시도하였습니다. 특히, input과 output을 뒤섞은 다양한 변형 데이터를 생성하여 학습에 활용하였습니다. 기존의 다층 BiLSTM 및 GRU 모델은 ‘난독화 → 번역’ 과정에서 문맥을 제대로 학습하지 못하는 한계가 있었습니다. 이를 극복하기 위해 여러 증강 방법을 실험한 결과, ‘번역본 → 번역본’ 학습 데이터를 추가했을 때 모델이 문맥을 더 잘 이해하며 성능이 향상되는 경향을 확인하였습니다. 이를 통해 기존 96% 수준이었던 성능을 97% 이상으로 개선할 수 있었습니다.

또한, 데이터의 특성과 입출력 구조를 고려하여 기존 형태소 기반 토크나이저 대신 음절 단위 커스텀 토크나이저를 사용하였습니다. 이를 활용하여 CBOW 방식으로 word2vec을 학습한 후, 가중치를 freeze하여 모델 학습에 적용하였습니다. 학습 효율성을 극대화하기 위해 최대한 경량화된 모델을 탐색하였으며, 그 결과 다층 GRU 및 LSTM 모델이 우수한 성능을 보임을 확인하였습니다. 특히, 파라미터 수가 25M으로 매우 가벼운 모델 구조를 유지하면서도, PLM(사전 학습된 언어 모델) 대비 하이퍼파라미터 튜닝 및 실사용이 용이하다는 장점이 있었습니다.

이외에도 다양한 모델을 실험하였으며, CNN + LSTM 구조 모델 또는 단순 CNN 기반 모델을 커스텀 토크나이저와 결합하였을 때도 97% 이상의 성능을 기록하였습니다. 

반면, LLaMA나 DeepSeek과 같은 대형 PLM 모델을 사용했을 때는 글자 수나 띄어쓰기를 임의로 변경하는 문제가 발생하였으며,  따라서, 이번 문제에서는 단순 대형 모델보다는 경량화된 모델과 도메인 맞춤형 토크나이저를 결합하는 것이 최적의 선택이었음을 확인할 수 있었습니다.

깃허브 : https://github.com/quant-jason/NKTL-Noised-Korean-Translator-by-LSTM

PDF
Code
Login Required
0 / 1000
다냐니라
2025.03.04 09:05

와 LLM 기반으로 안해도 잘 할 수 있는 테스크 였군요.. 하나 배워갑니다

hyican
2025.03.04 13:48

오히려 트랜스포머 기반 LLM은 불리한 점이 있었던 것 같네요 댓글 감사합니다

재현쨩123
2025.03.14 16:28

와... 대박이다

hyican
2025.03.17 16:48

댓글 감사합니다.