AI 평가 엔지니어: 소프트웨어 엔지니어의 새로운 영역

LLM·에이전트 시스템이 실제로 작동하는지, 회귀했는지 숫자로 증명하는 AI 평가 엔지니어. SWE-bench Verified의 오염 논란처럼 벤치마크가 신호를 잃자, 믿을 수 있는 평가 하니스를 짜는 일이 별도 직무로 갈라져 나왔다.

3 분 읽기

한 줄 요약

LLM·에이전트 시스템이 실제로 작동하는지, 회귀했는지 숫자로 증명하는 AI 평가 엔지니어. SWE-bench Verified의 오염 논란처럼 벤치마크가 신호를 잃자, 믿을 수 있는 평가 하니스를 짜는 일이 별도 직무로 갈라져 나왔다.

AI 평가 엔지니어: 소프트웨어 엔지니어의 새로운 영역

이 직업 한눈에

성장 전망 성장 중
수요 매우 높음
출처 및 참고 (8)

마지막 업데이트: 2026-01-30

이 분야가 중요한 이유

기업이 AI 기능을 실제 제품에 붙이기 시작하면서 질문이 둘로 좁혀진다. “이거 진짜 작동하나, 그리고 지난주보다 나빠지진 않았나.” 이 두 질문에 숫자로 답하는 일이 별도 엔지니어링 직무로 갈라져 나오고 있다. 2026년 7월 OpenAI가 공개한 “Separating signal from noise in coding evaluations"는 가장 널리 쓰이던 코딩 벤치마크 SWE-bench Verified가 설계 결함과 오염으로 더 이상 의미 있는 신호를 주지 못한다고 진단했다. 오픈소스 이슈와 PR은 원래 사람 협업용으로 만들어져서, 문제 설명·병합 코드·단위 테스트가 깔끔하게 격리된 과제로 맞아떨어지지 않는다는 것이다. OpenAI는 후속으로 밀던 SWE-Bench Pro 추천마저 문제를 발견하고 철회했다.

핵심은 “리더보드 점수"와 “우리 제품이 실제로 나아졌는가"가 다른 질문이라는 데 있다. 좋은 평가는 게임하기 어렵고, 신뢰할 수 있고, 모델 능력을 실제로 반영해야 한다. AI 평가 엔지니어는 바로 이 세 조건을 만족하는 평가 하니스를 짜는 사람이다. 모델을 더 키우는 팀과 별개로, 그 모델이 프로덕션에서 의도대로 도는지, 배포 전후로 회귀했는지를 증명하는 자리다. AI 도입이 빠른 조직일수록 이 자리가 먼저 필요해진다.

필요한 역량

일반 백엔드 역량 위에 평가 특화 레이어가 얹힌다. 첫째, 벤치마크·하니스 설계. 리더보드 하나 갖다 쓰는 게 아니라, 우리 제품의 실제 트래픽을 반영하는 평가셋을 직접 만들고 채점기를 붙인다. GeneBench-Pro가 알려진 인과 구조에서 문제를 생성해 결정론적으로 채점함으로써 루브릭 변동성을 피한 것처럼, “무엇을 정답으로 볼지"를 재현 가능하게 못 박는 게 출발점이다. 129문제 스위트에서 최신 모델도 30% 안팎에 머무른다는 사실은, 잘 만든 평가가 아직도 모델을 얼마나 가려내는지 보여준다.

둘째, 신호와 잡음 분리. 에이전트 벤치마크에는 환경 드리프트, 테스트 플래키니스, 정답 유출, 방법론 불투명성, 벤치마크와 프로덕션의 격차라는 구조적 함정이 있다. 점수 0.5%p 차이가 실제 개선인지 노이즈인지 통계적 신뢰구간으로 판정하고, 플래키한 테스트를 걸러내는 게 이 직무의 일상이다. 셋째, LLM-as-judge 보정과 온·오프라인 평가. 채점자 모델의 편향과 일관성을 메타 평가로 다시 검증하고, CI에 회귀 게이트를 심는 오프라인 평가와, 실서비스 로그로 돌리는 온라인 평가를 함께 운용한다. AgentDojo가 97개 과제와 629개 보안 케이스로 도구를 쓰는 에이전트의 적대적 견고성을 재는 것처럼, 적대적 케이스까지 평가셋에 넣는 감각도 필요하다. 도구로는 Python 평가 생태계, 트레이싱 인프라, 통계 처리가 핵심이다. 네카라쿠배급 AI 조직에서는 이 역량을 ML 플랫폼·신뢰성 팀이 빠르게 흡수하고 있다.

커리어 경로

주니어는 단일 태스크의 채점기부터 시작해 평가셋 구성과 메트릭 정의를 익힌다. 여기서 “정답으로 무엇을 셀 것인가"를 재현 가능하게 고정하는 감각, 그리고 플래키한 케이스를 걸러내는 눈을 기른다. 시니어는 신호 대 잡음을 가르는 통계 설계, LLM-judge의 편향 보정, 대규모 트레이스 처리 성능, 그리고 배포 파이프라인에 회귀 게이트를 심는 일을 맡는다. 리더 단계에서는 조직의 AI 품질 기준을 정의하고, 오프라인 벤치마크와 온라인 실측을 하나의 의사결정 루프로 엮어 “배포해도 되는가"를 제도화한다.

전형적 직함은 AI 평가 엔지니어, AI 신뢰성 엔지니어, LLM 품질 엔지니어, 평가 인프라 엔지니어다. 이 직무는 ML 플랫폼·데이터 엔지니어링·보안 엔지니어링과 인접하며, AI 기능을 빠르게 출시하는 조직일수록 “작동 증명"을 책임질 사람이 먼저 필요해진다.

관련 공모전 · 이벤트

유료 · 전문가 직접 조사

이 직업, 더 깊게 파고들고 싶다면

전문가가 직접 심층 조사해 이 직업의 시장·연봉·진입 전략·리스크까지 담은 맞춤 분석 리포트를 만들어 보내드립니다.

이 길을 걸은 사람들

태그

#software-engineer #AI-evaluation #eval-harness #reliability #LLM

자, 이제 시작해볼까?

위에 나온 사람들도 다 너처럼 시작했어. 뭐든 좋으니까 오늘 딱 하나만 해보자!

너도 할 수 있어! 여기 나온 사람들도 다 처음엔 아무것도 몰랐어.

관련 직업

데이터 과학자 (Data Scientist)

기술

데이터 과학자는 지저분한 데이터 더미 속에서 '그래서 우리가 뭘 해야 하지?'라는 질문에 답을 찾아주는 사람이야. 통계·코딩·비즈니스 감각을 한 데 섞어서 미래를 예측하고, 더 나은 결정을 내리도록 돕지. AI 시대에 가장 빠르게 변하고 있는 직업 중 하나라 더 흥미로워.

선생님 (Teacher)

교육

선생님은 학생들이 새로운 것을 배우고, 스스로 생각하고, 성장하도록 돕는 사람이야. 수업을 설계하고, 가르치고, 피드백을 주는 일을 넘어서, 한 사람의 인생 방향을 바꿔놓을 수도 있는 직업이지. AI가 '정보 전달'을 대신해가는 시대에, 선생님의 진짜 가치가 어디로 옮겨가는지 같이 들여다보자.

연구원 (Researcher)

과학

연구원은 아직 아무도 모르는 질문을 붙들고, 가설을 세우고 실험으로 검증해서 세상에 새로운 지식을 더하는 사람이야. 신약, 새로운 소재, AI 모델, 우주의 비밀까지, 오늘의 '몰라'를 내일의 '알아'로 바꾸는 직업이지. AI가 연구의 속도를 미친 듯이 끌어올리는 지금, 그 어느 때보다 흥미로운 길이기도 해.

크리에이터 (Content Creator)

미디어

크리에이터는 영상·이미지·글·오디오로 자기만의 이야기를 만들어 인터넷에 풀고, 그걸 보는 사람들과 관계를 쌓아 먹고사는 사람이야. 1인 미디어 회사를 운영하는 셈인데, 기획·촬영·편집·기획사·마케팅을 혼자 다 한다는 게 무섭고도 매력적인 지점이지.