딥보이스 범죄 대응을 위한 AI 탐지 모델 경진대회

알고리즘 | 코드 제출 평가 | 오디오 | 딥보이스

  • moneyIcon 상금 4,200만 원
  • 954명 종료까지 D-17

[배경]

생성형 인공지능과 음성합성 기술의 고도화로 실제 음성과 구분하기 어려운 딥보이스의 생성·활용이 확산되고 있습니다. 딥보이스가 보이스피싱, 음성 사칭 및 허위정보 생성 등에 악용됨에 따라, 다양한 생성기술과 실제 통신환경에서 발생하는 음성 변형에 대응할 수 있는 탐지 기술의 중요성이 높아지고 있습니다.

또한 생성형 AI를 활용한 음성뿐만 아니라 음악 등 다양한 형태의 오디오 생성·변조가 가능해짐에 따라, 딥보이스 탐지 역시 다양한 오디오 환경을 종합적으로 고려할 필요가 있습니다. 특히 하나의 오디오에 음성 또는 음악이 단독으로 존재하거나 함께 포함될 수 있는 환경에서, 각 유형의 존재 여부와 생성·변조 여부를 정확하게 판별할 수 있는 탐지 기술이 요구되고 있습니다.


[대회 방식]

본 대회는 1차 평가, 2차 평가순으로 진행됩니다.

🔹1차 평가: Private 리더보드 기준 상위 15팀을 2차 평가 진출팀으로 선정합니다.

🔹2차 평가: 진출팀은 '모델 개발 보고서'와 '학습데이터 구성 보고서'를 작성하여 제출해야 하며, 이를 종합적으로 평가하여 최종 상위 7팀을 수상팀으로 선정합니다.


[주제]

신종 보이스피싱 범죄 대응을 위한 AI 딥보이스 탐지 모델 개발


[설명]

본 대회는 오디오에 포함된 음성·음악의 존재 여부와 각 성분이 AI를 통해 생성되었는지를 탐지하는 문제입니다.


1. 평가 데이터 구성

  • 평가 데이터는 총 1,200개의 오디오 파일로 구성됩니다.
  • 각 파일의 길이는 4초 이상 1분 이하입니다.
  • 모든 오디오 파일은 16 kHz 샘플링레이트로 표준화되어 있습니다. 채널은 샘플 별로 모노/스테레오 모두 존재합니다.
  • 개발 모델은 MP3, WAV, FLAC 등 다양한 오디오 확장자를 입력으로 처리할 수 있도록 구현해야 하며, 평가 데이터도 다양한 오디오 확장자로 구성되어 있습니다.
  • 일부 샘플에는 전화채널 오디오가 포함되어 있습니다.


2. 오디오 유형

  • 음성: 사람의 발화 또는 보컬만 포함된 오디오
  • 음악: 보컬이 없는 반주·악기음만 포함된 오디오
  • 혼합: 음성과 음악이 동시에 또는 순차적으로 포함된 오디오

(*) 보컬은 음성 성분으로 분류합니다. 따라서 보컬과 반주가 함께 포함된 노래는 혼합 오디오에 해당합니다.


3. Real(0)·Fake(1) 기준

  • AI를 통해 생성된 음성 또는 음악 성분은 FAKE로 분류합니다.
  • AI를 통해 생성되지 않은 실제 원천의 음성 또는 음악 성분은 REAL로 분류합니다.
  • 음성과 음악 중 하나라도 FAKE이면 파일 전체를 FAKE로 분류합니다.
  • 실제 원천 오디오에 품질 개선, 잡음 제거, 음량 조정 등 음성·음악 성분 자체를 새로 생성하지 않는 후처리만 적용된 경우에는 REAL로 간주합니다.


4. 예측 항목

참가자는 입력 오디오 파일마다 다음 5개의 각각 0~1 사이의 확률을 예측해야 합니다.

  • FILE_FAKE_PROB: 파일 전체가 FAKE일 확률
  • VOICE_FAKE_PROB: 음성 성분이 FAKE일 확률
  • MUSIC_FAKE_PROB: 음악 성분이 FAKE일 확률
  • VOICE_PRESENT_PROB: 음성이 존재할 확률
  • MUSIC_PRESENT_PROB: 음악이 존재할 확률


[코드 제출 대회]

본 대회의 제출은 submit.zip 업로드 방식의 '코드 제출 대회'로 진행됩니다.

  • 전체 추론 실행 시간 ≤ 60분 (1,200개 오디오 샘플 파일 추론)
  • 패키지(라이브러리) 설치 시간 ≤ 10분
  • 제출 파일 용량 ≤ 10GB (*압축해제 후 최대 32GB)
  • 오프라인 환경 실행 (패키지 설치 외 인터넷 연결 불가능)
  • 6 vCPU, 28GB RAM, L4 GPU 22.4GiB VRAM 환경에서 실행

자세한 사항은 평가 탭코드 제출 가이드를 반드시 참고하여 진행하시길 바랍니다.


[참가 자격]

대한민국 국민 누구나


[주최 / 운영]

주최: 행정안전부, 한국지능정보사회진흥원

주관: 국립과학수사연구원

운영: 데이콘

대회 주요 일정

  1. 08.18

    참가 신청 시작

  2. 08.26

    대회 시작

  3. 09.23

    팀 병합 마감

  4. 09.29

    리더보드 제출 마감

  5. 09.30

    대회 종료

  1. 10.05

    2차 평가 자료 제출 마감

  2. 10.15

    2차 평가 및 검증 마감

  3. 10.16

    최종 결과 발표

  4. 11.27

    오프라인 시상식(예정)

[배경]

생성형 인공지능과 음성합성 기술의 고도화로 실제 음성과 구분하기 어려운 딥보이스의 생성·활용이 확산되고 있습니다. 딥보이스가 보이스피싱, 음성 사칭 및 허위정보 생성 등에 악용됨에 따라, 다양한 생성기술과 실제 통신환경에서 발생하는 음성 변형에 대응할 수 있는 탐지 기술의 중요성이 높아지고 있습니다.

또한 생성형 AI를 활용한 음성뿐만 아니라 음악 등 다양한 형태의 오디오 생성·변조가 가능해짐에 따라, 딥보이스 탐지 역시 다양한 오디오 환경을 종합적으로 고려할 필요가 있습니다. 특히 하나의 오디오에 음성 또는 음악이 단독으로 존재하거나 함께 포함될 수 있는 환경에서, 각 유형의 존재 여부와 생성·변조 여부를 정확하게 판별할 수 있는 탐지 기술이 요구되고 있습니다.


[대회 방식]

본 대회는 1차 평가, 2차 평가순으로 진행됩니다.

🔹1차 평가: Private 리더보드 기준 상위 15팀을 2차 평가 진출팀으로 선정합니다.

🔹2차 평가: 진출팀은 '모델 개발 보고서'와 '학습데이터 구성 보고서'를 작성하여 제출해야 하며, 이를 종합적으로 평가하여 최종 상위 7팀을 수상팀으로 선정합니다.


[주제]

신종 보이스피싱 범죄 대응을 위한 AI 딥보이스 탐지 모델 개발


[설명]

본 대회는 오디오에 포함된 음성·음악의 존재 여부와 각 성분이 AI를 통해 생성되었는지를 탐지하는 문제입니다.


1. 평가 데이터 구성

  • 평가 데이터는 총 1,200개의 오디오 파일로 구성됩니다.
  • 각 파일의 길이는 4초 이상 1분 이하입니다.
  • 모든 오디오 파일은 16 kHz 샘플링레이트로 표준화되어 있습니다. 채널은 샘플 별로 모노/스테레오 모두 존재합니다.
  • 개발 모델은 MP3, WAV, FLAC 등 다양한 오디오 확장자를 입력으로 처리할 수 있도록 구현해야 하며, 평가 데이터도 다양한 오디오 확장자로 구성되어 있습니다.
  • 일부 샘플에는 전화채널 오디오가 포함되어 있습니다.


2. 오디오 유형

  • 음성: 사람의 발화 또는 보컬만 포함된 오디오
  • 음악: 보컬이 없는 반주·악기음만 포함된 오디오
  • 혼합: 음성과 음악이 동시에 또는 순차적으로 포함된 오디오

(*) 보컬은 음성 성분으로 분류합니다. 따라서 보컬과 반주가 함께 포함된 노래는 혼합 오디오에 해당합니다.


3. Real(0)·Fake(1) 기준

  • AI를 통해 생성된 음성 또는 음악 성분은 FAKE로 분류합니다.
  • AI를 통해 생성되지 않은 실제 원천의 음성 또는 음악 성분은 REAL로 분류합니다.
  • 음성과 음악 중 하나라도 FAKE이면 파일 전체를 FAKE로 분류합니다.
  • 실제 원천 오디오에 품질 개선, 잡음 제거, 음량 조정 등 음성·음악 성분 자체를 새로 생성하지 않는 후처리만 적용된 경우에는 REAL로 간주합니다.


4. 예측 항목

참가자는 입력 오디오 파일마다 다음 5개의 각각 0~1 사이의 확률을 예측해야 합니다.

  • FILE_FAKE_PROB: 파일 전체가 FAKE일 확률
  • VOICE_FAKE_PROB: 음성 성분이 FAKE일 확률
  • MUSIC_FAKE_PROB: 음악 성분이 FAKE일 확률
  • VOICE_PRESENT_PROB: 음성이 존재할 확률
  • MUSIC_PRESENT_PROB: 음악이 존재할 확률


[코드 제출 대회]

본 대회의 제출은 submit.zip 업로드 방식의 '코드 제출 대회'로 진행됩니다.

  • 전체 추론 실행 시간 ≤ 60분 (1,200개 오디오 샘플 파일 추론)
  • 패키지(라이브러리) 설치 시간 ≤ 10분
  • 제출 파일 용량 ≤ 10GB (*압축해제 후 최대 32GB)
  • 오프라인 환경 실행 (패키지 설치 외 인터넷 연결 불가능)
  • 6 vCPU, 28GB RAM, L4 GPU 22.4GiB VRAM 환경에서 실행

자세한 사항은 평가 탭코드 제출 가이드를 반드시 참고하여 진행하시길 바랍니다.


[참가 자격]

대한민국 국민 누구나


[주최 / 운영]

주최: 행정안전부, 한국지능정보사회진흥원

주관: 국립과학수사연구원

운영: 데이콘

대회 주요 일정

  1. 08.18

    참가 신청 시작
  2. 08.26

    대회 시작
  3. 09.23

    팀 병합 마감
  4. 09.29

    리더보드 제출 마감
  5. 09.30

    대회 종료
  6. 10.05

    2차 평가 자료 제출 마감
  7. 10.15

    2차 평가 및 검증 마감
  8. 10.16

    최종 결과 발표
  9. 11.27

    오프라인 시상식(예정)