모티프와 독자 AI의 시험대 · 3부 / 4부
10명·49명·185명…AI 점수 뒤의 사람들
전문가10명, AI 전문 사용자49명, 일반 국민185명이 평가에 참여했다. 정부가 공개한 익명 평가위원별 점수로 최고·최저 제외 평균을 직접 확인하고, 가상 실험을 별도로 구분해 집계 방식의 효과를 살핀다.

AI의 답을 평가한 사람들은 누구였을까요. 정부 자료에는 평가단의 규모와 구성뿐 아니라 익명 평가위원별 점수도 나옵니다. 다만 점수표가 개별 채점 이유까지 모두 설명하는 것은 아닙니다. 공개된 숫자로 확인할 수 있는 것과 추가 설명이 필요한 것을 나눠보겠습니다.
선정한 사람과 평가한 사람은 다릅니다
과기정통부의 2026년 8월 27일 자료에 따르면 전문가 평가는 외부 전문가 10명이 맡았습니다. 산업계 3명, 학계 5명, 연구계 2명입니다. 약 5일 동안 서면평가와 질의응답을 진행했고 최고점과 최저점을 제외한 산술평균으로 점수를 정리했습니다.
AI 전문 사용자진은 AI 스타트업 대표 50명을 선정했지만 실제 참여자는 49명입니다. 일반 국민은 주민등록인구 통계를 기준으로 성별·연령별 쿼터를 두고 무작위로 200명을 선정했으며 185명이 참여했습니다. 선정 규모와 참여 규모를 같은 숫자로 적으면 실제 평가에 참여한 사람을 잘못 세게 됩니다.
사용자 평가 두 집단은 1점에서 5점을 주고, 이를 각각 15점과 10점 만점으로 환산했습니다. 같은 척도의 응답이라도 종합평가에서 차지하는 배점은 다릅니다. 참여자가 더 많다는 이유만으로 더 높은 비중을 가진 평가라는 뜻은 아닙니다.
직접 해보는 기사 · 3/4
평균을 움직이는 한 점
익명 평가위원의 공개 점수를 확인하고, 가상 실험을 따로 선택해 평균의 변화를 비교합니다.
아래 본문과 원자료 표로도 같은 내용을 확인할 수 있습니다. 조작 기능은 자바스크립트가 켜진 환경에서 작동합니다.
전문가는 무엇을 보았나
전문가 평가의 배점은 35점입니다. 세부 기준은 개발 전략 및 기술 10점, 개발 성과 및 계획 10점, 파급효과 및 기여계획 15점입니다. 모델이 문제를 맞힌 비율만 평가하는 칸은 아니라는 점을 이 구성이 보여줍니다.
이런 기준은 연구개발 지원사업이 어떤 성과를 기대하는지와 연결됩니다. 다만 항목 이름과 배점만 알아서는 특정 팀이 왜 몇 점을 잃었는지까지 설명할 수 없습니다. 개발계획의 어떤 부분을 어떻게 판단했는지 확인하려면 평가의 세부 근거가 더 필요합니다.
정부는 단계별 목표와 평가 기준을 정예팀들과 협의해 마련하고 최종안을 안내했으며 당시 이견이 없었다고 설명했습니다. 이는 정부의 절차 설명입니다. 그 문장만으로 모든 팀이 결과나 개별 채점에도 동의했다고 넓혀 읽을 수는 없습니다. 사전 기준 합의와 사후 점수의 납득은 다른 문제니까요.
극단값을 빼면 무엇이 달라질까
정부의 붙임 3에는 전문가 10명이 각 팀에 준 점수와 세부 항목별 점수가 있습니다. 모티프의 위원별 합산점수는 24·29·26·32·29·31·17·22·28·28점입니다. 단순평균은 26.6점이지만 최고 32점과 최저 17점을 하나씩 빼고 8개의 값을 평균하면 27.125점입니다. 공표된 소수 첫째 자리 값은 27.1점입니다.
최고·최저 제외 방식은 극단값이 평균을 흔드는 영향을 줄입니다. 그렇다고 나머지 평가의 차이나 판단 기준의 불명확함까지 없애주는 장치는 아닙니다. 숫자를 어떻게 모으는지와 왜 그 점수를 줬는지는 따로 확인해야 합니다.
모티프의 열 점수 가운데 17점과 32점을 제외하면 나머지 8개 점수만 평균에 들어갑니다. 다른 팀도 같은 방식으로 계산합니다. 낮은 점수 하나를 지웠다고 늘 평균이 올라가는 것은 아닙니다. 높은 점수도 동시에 제외하기 때문입니다. 남은 값의 분포를 함께 봐야 집계의 효과를 알 수 있습니다.
손잡이를 크게 움직여도 제외 평균이 덜 움직이는 구간이 보일 겁니다. 어떤 값이 제외되는지가 바뀌면 평균도 달라집니다. 극단값을 뺀다는 규칙이 모든 점수 차이를 없애주는 것은 아닙니다. 실제 점수로 돌아가기 버튼을 누르면 공표자료의 원점수를 다시 확인할 수 있습니다.
평균 2.8점에 가려진 응답들
모티프에 점수를 준 AI 전문 사용자 49명 가운데 1점은 10명,2점 8명,3점 15명,4점 14명,5점 2명입니다. 점수합 137을 49로 나눈 평균은 약 2.80점입니다. 이를 15점 만점으로 환산하고 소수 첫째 자리로 반올림하면 공표값 8.4점이 됩니다.
일반국민 185명의 모티프 평가는 1점 11명,2점 55명,3점 76명,4점 36명,5점 7명입니다. 평균은 약 2.85점이고 10점 만점 환산값은 5.7점입니다. 두 평균이 비슷해도 참여집단과 분포는 다릅니다. 이 응답을 전체 국민의 평가로 일반화하거나,응답자의 신원을 추정할 수는 없습니다.
평균 뒤의 1점부터 5점까지
공통 눈금 0–185명
49명 응답 · 5점 만점 평균 2.80점 · 환산 공표점수 8.4점.
공개된 익명 응답입니다. 집단 간 표본수가 다르며 전체 국민의 선호도 조사로 일반화할 수 없습니다.
모든 값과 범위 확인
| 범위 | 항목 | 값 |
|---|---|---|
| AI 전문 사용자 · 업스테이지 | 1점 | 2명 |
| AI 전문 사용자 · 업스테이지 | 2점 | 6명 |
| AI 전문 사용자 · 업스테이지 | 3점 | 12명 |
| AI 전문 사용자 · 업스테이지 | 4점 | 19명 |
| AI 전문 사용자 · 업스테이지 | 5점 | 10명 |
| AI 전문 사용자 · SK텔레콤 | 1점 | 1명 |
| AI 전문 사용자 · SK텔레콤 | 2점 | 2명 |
| AI 전문 사용자 · SK텔레콤 | 3점 | 13명 |
| AI 전문 사용자 · SK텔레콤 | 4점 | 20명 |
| AI 전문 사용자 · SK텔레콤 | 5점 | 13명 |
| AI 전문 사용자 · LG AI연구원 | 1점 | 1명 |
| AI 전문 사용자 · LG AI연구원 | 2점 | 7명 |
| AI 전문 사용자 · LG AI연구원 | 3점 | 9명 |
| AI 전문 사용자 · LG AI연구원 | 4점 | 18명 |
| AI 전문 사용자 · LG AI연구원 | 5점 | 14명 |
| AI 전문 사용자 · 모티프테크놀로지스 | 1점 | 10명 |
| AI 전문 사용자 · 모티프테크놀로지스 | 2점 | 8명 |
| AI 전문 사용자 · 모티프테크놀로지스 | 3점 | 15명 |
| AI 전문 사용자 · 모티프테크놀로지스 | 4점 | 14명 |
| AI 전문 사용자 · 모티프테크놀로지스 | 5점 | 2명 |
| 일반 국민 · 업스테이지 | 1점 | 2명 |
| 일반 국민 · 업스테이지 | 2점 | 18명 |
| 일반 국민 · 업스테이지 | 3점 | 56명 |
| 일반 국민 · 업스테이지 | 4점 | 76명 |
| 일반 국민 · 업스테이지 | 5점 | 33명 |
| 일반 국민 · SK텔레콤 | 1점 | 2명 |
| 일반 국민 · SK텔레콤 | 2점 | 12명 |
| 일반 국민 · SK텔레콤 | 3점 | 54명 |
| 일반 국민 · SK텔레콤 | 4점 | 75명 |
| 일반 국민 · SK텔레콤 | 5점 | 42명 |
| 일반 국민 · LG AI연구원 | 1점 | 7명 |
| 일반 국민 · LG AI연구원 | 2점 | 18명 |
| 일반 국민 · LG AI연구원 | 3점 | 36명 |
| 일반 국민 · LG AI연구원 | 4점 | 70명 |
| 일반 국민 · LG AI연구원 | 5점 | 54명 |
| 일반 국민 · 모티프테크놀로지스 | 1점 | 11명 |
| 일반 국민 · 모티프테크놀로지스 | 2점 | 55명 |
| 일반 국민 · 모티프테크놀로지스 | 3점 | 76명 |
| 일반 국민 · 모티프테크놀로지스 | 4점 | 36명 |
| 일반 국민 · 모티프테크놀로지스 | 5점 | 7명 |
표본의 크기만으로 공정성을 답할 수는 없습니다
전문 사용자와 일반 국민은 서로 다른 관점에서 모델을 사용합니다. 어떤 과제를 주고 어떤 방식으로 답을 비교하게 했는지에 따라 평가의 의미도 달라집니다. 참여자 수는 그 절차를 이해할 정보 중 하나지만, 수만 크다고 비교 조건이 같았다는 보장이 생기지는 않습니다.
공개된 자료로 인원과 배점, 집계 방식, 익명 참여자의 점수를 확인할 수 있습니다. 반면 이 보도자료에는 각 평가자가 왜 그 점수를 줬는지 설명한 서술형 심사평이나 과제별 응답 내용까지 담겨 있지는 않습니다. 결과를 더 잘 설명하려면 추가로 어떤 정보를 공개하거나 검증할 수 있는지 논의할 필요가 있습니다.
점수의 합을 확인하는 것에서 평가 기준을 묻는 것으로 질문이 옮겨왔습니다. 마지막 4편에서는 배점이 달라지면 순위가 얼마나 민감하게 움직이는지 가상 실험을 해보겠습니다. 목적에 맞는 시험을 설계한다는 것은 어떤 선택인지 살펴볼 차례입니다.
수치와 절차 다시 보기
| 팀 | AAII/25 | NIA/15 | 전문가/35 | AI사용자/15 | 국민/10 | 합계/100 |
|---|---|---|---|---|---|---|
| SK텔레콤 | 8.8 | 13.4 | 29.3 | 11.6 | 7.5 | 70.6 |
| 업스테이지 | 9.4 | 13.3 | 29.1 | 10.8 | 7.3 | 69.9 |
| LG AI연구원 | 7.8 | 12.8 | 29.5 | 11.3 | 7.6 | 69.0 |
| 모티프테크놀로지스 | 11.9 | 12.7 | 27.1 | 8.4 | 5.7 | 65.8 |
자료 직접 확인
법령·통계·목록 확인 기준:2026-09-20. 가상 실험은 화면에 별도로 표시했습니다. 공표점수와 가상실험, 보급기록과 실제 이용실적을 구분합니다.
기획 개편과 정정 안내
기존 한 편짜리 기획을4부작으로 재편했습니다. 실제공표점수와가상실험을구분하고,원문을확보하지못한이의신청기각의시점·사유는단정하지않았습니다.