01진행 방식
참가자는 환자의 기본 정보와 초기 증상을 바탕으로 문진, 진찰, 검사를 수행하는 Doctor Agent를 개발합니다. 환자의 전체 정보는 공개되지 않으며, 허용된 인터페이스를 통해 필요한 정보를 획득합니다.
ASK문진
환자에게 질문해 병력과 증상 등 진단 단서를 수집합니다.
EXAM신체진찰
신체진찰을 선택하고 소견을 확인합니다.
TEST검사
필요한 검사와 영상검사를 선택합니다.
DIAGNOSE최종 진단
수집한 정보를 종합해 최종 진단을 제출합니다.
한 증례당 최대 60턴의 상호작용을 허용합니다. 문진·진찰·검사 선택은 필요에 따라 반복할 수 있습니다.
02평가 기준
예선은 대회 서버에서 자동 채점한 점수만으로 평가합니다. 점수는 아래 세 기준을 반영합니다.
Accuracy
진단 정확도
최종 진단이 얼마나 정확한가
Efficiency
정보 획득 효율성
필요한 정보를 효율적으로 얻었는가
Safety
임상적 안전성
적절한 질문과 검사를 선택했는가
세부 지표와 가중치, 본선 평가 방식은 예선 시작 전에 공개합니다.
03개발 및 제출
개발 단계에서는 공개된 샘플 증례를 이용해 에이전트를 실험합니다. 채점 단계에서는 제출한 코드를 대회 서버에서 실행해 비공개 증례를 평가합니다.
- 예선은 평가 서버에 준비된 고정 LLM
openai/gpt-oss-20b를 사용하며, 모델 파일은 제출하지 않습니다. 본선에서는 VRAM 20GB 이하의 모델을 자유롭게 제출할 수 있습니다. - 제출 파일:
run.py와requirements.txt를 포함한 ZIP 파일 - 제출 파일 크기: 최대 50MB
- 채점 증례 원문과 실행 산출물은 참가자에게 제공하지 않습니다.
- API 사용법, 실행 환경, 제출 횟수와 정확한 마감 시각은 참가자 가이드에서 안내합니다.