AI 한국어 성능은 어떻게 실측하고 채점하나요?
AI위키의 점수는 두 종류뿐입니다. 우리가 같은 프롬프트로 직접 돌려 채점한 실측 점수, 그리고 외부 리더보드에서 그대로 가져온 자동 수집 지표. 둘을 섞지 않고, 둘 다 측정일·수집일과 출처를 붙입니다.
1. 실측 절차
- 용도별로 프롬프트 1개를 정합니다(예: 한국어 종합 = 회의 녹취록을 결정사항·담당자·기한 표로 정리). 프롬프트 원문은 결과와 함께 공개합니다.
- 같은 날, 같은 입력을 각 도구에 넣습니다. API가 있는 도구는 OpenRouter를 통해 같은 설정(temperature 0, 출력 상한 3,000토큰, 추론 강도 낮음)으로 호출하고, API가 없는 국산 도구는 웹 화면(일반 사용자 계정)에서 실행합니다. 도구마다 실행한 플랜(무료/유료)과 모델 버전을 기록하며, 모델 이름은 각 결과의 툴팁과 도구 페이지에 표시합니다. 모델 등급이 도구마다 다를 수 있음(예: 제미나이는 flash 계열, 다른 도구는 최상위 모델)을 감안해 읽어 주세요. 출력 상한 때문에 답이 잘린 경우는 재실행 대상으로 표시합니다.
- 첫 응답이 끝날 때까지 시간을 재고, API 호출이면 실제 청구된 토큰 비용을 원화로 계산해 1회 비용으로 표시합니다. 웹 화면(구독제)으로 실행한 경우는 1회 비용을 산정하지 않고 플랜 요금만 표시합니다. API 응답 시간은 웹 화면 체감과 다를 수 있습니다.
- 아래 채점표로 채점합니다. 결과지는 도구 이름을 가리고 무작위 순서로 섞은 뒤, AI 채점기(앤트로픽 Claude)가 채점표 항목별로 점수와 근거를 내고 운영자가 검수합니다. 클로드 자신의 결과도 같은 조건(이름 가림)으로 채점되며, 이 점은 이해충돌 소지가 있어 여기에 밝혀 둡니다. 채점 근거(한 줄 요약)는 각 도구 페이지에 공개합니다.
- 결과 JSON을 데이터베이스에 넣고 홈의 "이번 주 실측 표"와 각 도구 페이지에 표시합니다. 실측은 주 1회를 목표로 하되 못 한 주는 지난 측정일을 그대로 보여 줍니다.
2. 채점표 (100점)
| 항목 | 배점 | 기준 |
|---|---|---|
| 정확성 | 40 | 원문에 있는 내용만, 빠짐·왜곡 없이 담았는가 |
| 존댓말·톤 | 30 | 요청한 어투(존댓말)를 끝까지 유지하고 번역투가 없는가 |
| 형식 | 30 | 요청한 형식(표·항목·길이)을 지켰는가 |
항목별 점수는 도구 페이지의 실측 결과 카드에 그대로 표시합니다. 감점 예시: 원문에 없는 기한을 지어내면 정확성에서 크게 감점, 중간에 반말이 섞이면 톤에서 감점, 표를 요청했는데 줄글로 답하면 형식에서 감점.
3. 순위에 반영하지 않는 것
- 제휴 여부. 제휴 링크가 있는 도구도, 없는 도구도 같은 채점표로만 순위가 정해집니다. 제휴 링크는 버튼 옆에 "제휴 링크(수수료 지급)"라고 표시합니다.
- 광고. 광고 카드는 "광고"라고 표시하고 실측 점수를 붙이지 않습니다.
- 실측하지 않은 도구. 점수 칸을 비워 둡니다. 추정치를 넣지 않습니다.
4. 자동 수집 지표의 출처
- 가격·컨텍스트 길이: OpenRouter
- 종합 리더보드: Artificial Analysis, LMArena
- 한국어 리더보드: Open Ko-LLM Leaderboard, Horangi
- 환율: 매일 새벽 1회 수집해 원화 환산에 사용. 환산에 쓴 환율은 요금표에 함께 표시합니다.
자동 수집 값은 매일 새벽 1회 갱신하며, 각 값 옆에 출처 링크와 수집일을 붙입니다. 2026년 9월 현재 실제로 수집되는 출처는 OpenRouter와 LMArena이며, Artificial Analysis(API 키 발급 후)와 Open Ko-LLM(공개 모델만 해당)은 준비 중입니다. Horangi는 API가 없어 자동 수집하지 않습니다.
5. 요금 확인 방법
요금 한 칸에는 원화 환산가, 부가세 포함 여부, 해외결제 수수료 안내, 국내 카드 결제 가능 여부, 환불 정책, 확인일을 함께 적습니다. 공식 요금 페이지를 직접 확인한 날짜가 확인일이며, 공식 페이지에서 확인되지 않은 항목은 "—"로 둡니다.