기사 본문으로
아시아24묻고 답하다

모티프와 독자 AI의 시험대 · 3부 / 4부

10명·49명·185명…AI 점수 뒤의 사람들

기사요약

전문가10명, AI 전문 사용자49명, 일반 국민185명이 평가에 참여했다. 정부가 공개한 익명 평가위원별 점수로 최고·최저 제외 평균을 직접 확인하고, 가상 실험을 별도로 구분해 집계 방식의 효과를 살핀다.

서버 장비 자료사진(2011년). 기사에 등장하는 네 팀의 시설을 촬영한 사진은 아닙니다.
서버 장비 자료사진(2011년). 기사에 등장하는 네 팀의 시설을 촬영한 사진은 아닙니다. [사진 | Abigor · CC BY-SA 3.0] 원 출처의 축소본, 화면 비율에 맞춰 일부 잘라 표시.

AI의 답을 평가한 사람들은 누구였을까요. 정부 자료에는 평가단의 규모와 구성뿐 아니라 익명 평가위원별 점수도 나옵니다. 다만 점수표가 개별 채점 이유까지 모두 설명하는 것은 아닙니다. 공개된 숫자로 확인할 수 있는 것과 추가 설명이 필요한 것을 나눠보겠습니다.

선정한 사람과 평가한 사람은 다릅니다

과기정통부의 2026년 8월 27일 자료에 따르면 전문가 평가는 외부 전문가 10명이 맡았습니다. 산업계 3명, 학계 5명, 연구계 2명입니다. 약 5일 동안 서면평가와 질의응답을 진행했고 최고점과 최저점을 제외한 산술평균으로 점수를 정리했습니다.

AI 전문 사용자진은 AI 스타트업 대표 50명을 선정했지만 실제 참여자는 49명입니다. 일반 국민은 주민등록인구 통계를 기준으로 성별·연령별 쿼터를 두고 무작위로 200명을 선정했으며 185명이 참여했습니다. 선정 규모와 참여 규모를 같은 숫자로 적으면 실제 평가에 참여한 사람을 잘못 세게 됩니다.

사용자 평가 두 집단은 1점에서 5점을 주고, 이를 각각 15점과 10점 만점으로 환산했습니다. 같은 척도의 응답이라도 종합평가에서 차지하는 배점은 다릅니다. 참여자가 더 많다는 이유만으로 더 높은 비중을 가진 평가라는 뜻은 아닙니다.

직접 해보는 기사 · 3/4

평균을 움직이는 한 점

익명 평가위원의 공개 점수를 확인하고, 가상 실험을 따로 선택해 평균의 변화를 비교합니다.

아래 본문과 원자료 표로도 같은 내용을 확인할 수 있습니다. 조작 기능은 자바스크립트가 켜진 환경에서 작동합니다.

전문가는 무엇을 보았나

전문가 평가의 배점은 35점입니다. 세부 기준은 개발 전략 및 기술 10점, 개발 성과 및 계획 10점, 파급효과 및 기여계획 15점입니다. 모델이 문제를 맞힌 비율만 평가하는 칸은 아니라는 점을 이 구성이 보여줍니다.

이런 기준은 연구개발 지원사업이 어떤 성과를 기대하는지와 연결됩니다. 다만 항목 이름과 배점만 알아서는 특정 팀이 왜 몇 점을 잃었는지까지 설명할 수 없습니다. 개발계획의 어떤 부분을 어떻게 판단했는지 확인하려면 평가의 세부 근거가 더 필요합니다.

정부는 단계별 목표와 평가 기준을 정예팀들과 협의해 마련하고 최종안을 안내했으며 당시 이견이 없었다고 설명했습니다. 이는 정부의 절차 설명입니다. 그 문장만으로 모든 팀이 결과나 개별 채점에도 동의했다고 넓혀 읽을 수는 없습니다. 사전 기준 합의와 사후 점수의 납득은 다른 문제니까요.

극단값을 빼면 무엇이 달라질까

정부의 붙임 3에는 전문가 10명이 각 팀에 준 점수와 세부 항목별 점수가 있습니다. 모티프의 위원별 합산점수는 24·29·26·32·29·31·17·22·28·28점입니다. 단순평균은 26.6점이지만 최고 32점과 최저 17점을 하나씩 빼고 8개의 값을 평균하면 27.125점입니다. 공표된 소수 첫째 자리 값은 27.1점입니다.

최고·최저 제외 방식은 극단값이 평균을 흔드는 영향을 줄입니다. 그렇다고 나머지 평가의 차이나 판단 기준의 불명확함까지 없애주는 장치는 아닙니다. 숫자를 어떻게 모으는지와 왜 그 점수를 줬는지는 따로 확인해야 합니다.

모티프의 열 점수 가운데 17점과 32점을 제외하면 나머지 8개 점수만 평균에 들어갑니다. 다른 팀도 같은 방식으로 계산합니다. 낮은 점수 하나를 지웠다고 늘 평균이 올라가는 것은 아닙니다. 높은 점수도 동시에 제외하기 때문입니다. 남은 값의 분포를 함께 봐야 집계의 효과를 알 수 있습니다.

손잡이를 크게 움직여도 제외 평균이 덜 움직이는 구간이 보일 겁니다. 어떤 값이 제외되는지가 바뀌면 평균도 달라집니다. 극단값을 뺀다는 규칙이 모든 점수 차이를 없애주는 것은 아닙니다. 실제 점수로 돌아가기 버튼을 누르면 공표자료의 원점수를 다시 확인할 수 있습니다.

평균 2.8점에 가려진 응답들

모티프에 점수를 준 AI 전문 사용자 49명 가운데 1점은 10명,2점 8명,3점 15명,4점 14명,5점 2명입니다. 점수합 137을 49로 나눈 평균은 약 2.80점입니다. 이를 15점 만점으로 환산하고 소수 첫째 자리로 반올림하면 공표값 8.4점이 됩니다.

일반국민 185명의 모티프 평가는 1점 11명,2점 55명,3점 76명,4점 36명,5점 7명입니다. 평균은 약 2.85점이고 10점 만점 환산값은 5.7점입니다. 두 평균이 비슷해도 참여집단과 분포는 다릅니다. 이 응답을 전체 국민의 평가로 일반화하거나,응답자의 신원을 추정할 수는 없습니다.

평균 뒤의 1점부터 5점까지

1점
10.00명
2점
8.00명
3점
15.00명
4점
14.00명
5점
2.00명

공통 눈금 0–185명

49명 응답 · 5점 만점 평균 2.80점 · 환산 공표점수 8.4점.

공개된 익명 응답입니다. 집단 간 표본수가 다르며 전체 국민의 선호도 조사로 일반화할 수 없습니다.

자료 | 과기정통부 · 2026-08-27 붙임4·5

모든 값과 범위 확인
평균 뒤의 1점부터 5점까지 · 원자료 값
범위항목
AI 전문 사용자 · 업스테이지1점2명
AI 전문 사용자 · 업스테이지2점6명
AI 전문 사용자 · 업스테이지3점12명
AI 전문 사용자 · 업스테이지4점19명
AI 전문 사용자 · 업스테이지5점10명
AI 전문 사용자 · SK텔레콤1점1명
AI 전문 사용자 · SK텔레콤2점2명
AI 전문 사용자 · SK텔레콤3점13명
AI 전문 사용자 · SK텔레콤4점20명
AI 전문 사용자 · SK텔레콤5점13명
AI 전문 사용자 · LG AI연구원1점1명
AI 전문 사용자 · LG AI연구원2점7명
AI 전문 사용자 · LG AI연구원3점9명
AI 전문 사용자 · LG AI연구원4점18명
AI 전문 사용자 · LG AI연구원5점14명
AI 전문 사용자 · 모티프테크놀로지스1점10명
AI 전문 사용자 · 모티프테크놀로지스2점8명
AI 전문 사용자 · 모티프테크놀로지스3점15명
AI 전문 사용자 · 모티프테크놀로지스4점14명
AI 전문 사용자 · 모티프테크놀로지스5점2명
일반 국민 · 업스테이지1점2명
일반 국민 · 업스테이지2점18명
일반 국민 · 업스테이지3점56명
일반 국민 · 업스테이지4점76명
일반 국민 · 업스테이지5점33명
일반 국민 · SK텔레콤1점2명
일반 국민 · SK텔레콤2점12명
일반 국민 · SK텔레콤3점54명
일반 국민 · SK텔레콤4점75명
일반 국민 · SK텔레콤5점42명
일반 국민 · LG AI연구원1점7명
일반 국민 · LG AI연구원2점18명
일반 국민 · LG AI연구원3점36명
일반 국민 · LG AI연구원4점70명
일반 국민 · LG AI연구원5점54명
일반 국민 · 모티프테크놀로지스1점11명
일반 국민 · 모티프테크놀로지스2점55명
일반 국민 · 모티프테크놀로지스3점76명
일반 국민 · 모티프테크놀로지스4점36명
일반 국민 · 모티프테크놀로지스5점7명

표본의 크기만으로 공정성을 답할 수는 없습니다

전문 사용자와 일반 국민은 서로 다른 관점에서 모델을 사용합니다. 어떤 과제를 주고 어떤 방식으로 답을 비교하게 했는지에 따라 평가의 의미도 달라집니다. 참여자 수는 그 절차를 이해할 정보 중 하나지만, 수만 크다고 비교 조건이 같았다는 보장이 생기지는 않습니다.

공개된 자료로 인원과 배점, 집계 방식, 익명 참여자의 점수를 확인할 수 있습니다. 반면 이 보도자료에는 각 평가자가 왜 그 점수를 줬는지 설명한 서술형 심사평이나 과제별 응답 내용까지 담겨 있지는 않습니다. 결과를 더 잘 설명하려면 추가로 어떤 정보를 공개하거나 검증할 수 있는지 논의할 필요가 있습니다.

점수의 합을 확인하는 것에서 평가 기준을 묻는 것으로 질문이 옮겨왔습니다. 마지막 4편에서는 배점이 달라지면 순위가 얼마나 민감하게 움직이는지 가상 실험을 해보겠습니다. 목적에 맞는 시험을 설계한다는 것은 어떤 선택인지 살펴볼 차례입니다.

수치와 절차 다시 보기

2026년2차 평가 공표점수
AAII/25NIA/15전문가/35AI사용자/15국민/10합계/100
SK텔레콤8.813.429.311.67.570.6
업스테이지9.413.329.110.87.369.9
LG AI연구원7.812.829.511.37.669.0
모티프테크놀로지스11.912.727.18.45.765.8

자료 직접 확인

  1. 과기정통부·NIPA 2026-08-27 세부점수·평가방식

법령·통계·목록 확인 기준:2026-09-20. 가상 실험은 화면에 별도로 표시했습니다. 공표점수와 가상실험, 보급기록과 실제 이용실적을 구분합니다.

기획 개편과 정정 안내

기존 한 편짜리 기획을4부작으로 재편했습니다. 실제공표점수와가상실험을구분하고,원문을확보하지못한이의신청기각의시점·사유는단정하지않았습니다.