AI 비교AI 찾기AI 뉴스AI 활용
회사 소개
개인정보처리방침이용약관FAQ문의하기문의하기
에이아이비 주식회사사업자정보
© 2026 AIB Inc.

OpenRouter, LLM 평가법 설명

OpenRouter, LLM 평가법 설명

OpenRouter·2026년 9월 21일 (월)
  • •OpenRouter는 결정론적 테스트가 놓칠 수 있는 AI 에이전트 답변을 평가하는 LLM-as-a-judge 채점법을 설명했다
  • •Ori Eval은 환불 정책 예시에서 setupJudge(), autoEvals(), Bun 테스트, minScore 0.8을 사용한다
  • •OpenRouter는 2023년 judge-bias 연구를 인용하며 사람이 라벨링한 예시로 보정하라고 권고했다
  • •OpenRouter는 결정론적 테스트가 놓칠 수 있는 AI 에이전트 답변을 평가하는 LLM-as-a-judge 채점법을 설명했다
  • •Ori Eval은 환불 정책 예시에서 setupJudge(), autoEvals(), Bun 테스트, minScore 0.8을 사용한다
  • •OpenRouter는 2023년 judge-bias 연구를 인용하며 사람이 라벨링한 예시로 보정하라고 권고했다
  • •OpenRouter는 결정론적 테스트가 놓칠 수 있는 AI 에이전트 답변을 평가하는 LLM-as-a-judge 채점법을 설명했다
  • •Ori Eval은 환불 정책 예시에서 setupJudge(), autoEvals(), Bun 테스트, minScore 0.8을 사용한다
  • •OpenRouter는 2023년 judge-bias 연구를 인용하며 사람이 라벨링한 예시로 보정하라고 권고했다
  • •OpenRouter는 결정론적 테스트가 놓칠 수 있는 AI 에이전트 답변을 평가하는 LLM-as-a-judge 채점법을 설명했다
  • •Ori Eval은 환불 정책 예시에서 setupJudge(), autoEvals(), Bun 테스트, minScore 0.8을 사용한다
  • •OpenRouter는 2023년 judge-bias 연구를 인용하며 사람이 라벨링한 예시로 보정하라고 권고했다

OpenRouter는 9/14/2026 튜토리얼을 통해 개발자가 결정론적 테스트로 잡기 어려운 AI 에이전트 출력을 LLM-as-a-judge 평가로 채점하는 방법을 설명했다. 튜토리얼에 따르면 에이전트는 올바른 도구를 호출하고 정확한 정책을 가져와도, 최종 답변에서 환불 가능 기간을 빠뜨리는 식으로 불완전한 답을 낼 수 있다. LLM-as-a-judge는 두 번째 모델이 후보 에이전트의 사용자에게 보이는 출력을 쉬운 문장 기준과 대조해 점수를 내고, 점수가 선택한 기준값 아래로 떨어지면 평가 실패를 발생시켜 그 공백을 메운다.

OpenRouter는 후보 모델과 판정 모델을 구분했다. 후보 모델은 사용자에게 답하고 도구를 호출하며 테스트 대상 출력을 만들지만, 판정 모델은 과제를 직접 풀지 않고 후보가 이미 만든 결과만 채점한다. 튜토리얼은 가능하면 두 역할에 다른 모델을 쓰라고 권고하면서, Zheng 등 연구진이 self-enhancement, position, verbosity 편향을 확인한 2023년 논문 “Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena”를 인용했다. 또한 판정 모델에는 보이는 응답과 채점 기준에 필요한 도구 결과만 제공해야 하며, 숨겨진 추론은 보여주지 않아야 한다고 설명했다.

튜토리얼은 exact-match 검사, 결정론적 내용 검사, rubric 채점, 사람 검토를 나눴다. exact match는 정답 값이 정확히 1개인 경우에 맞고, Ori Eval의 run.toMention()은 주변 표현이 달라도 필수 문구가 등장하는지 확인한다. rubric은 사람이 적용할 수 있는 규칙으로 작성해야 하며, 예컨대 답변이 14-day refund window를 언급하고 지어낸 예외를 피하는지 같은 기준이 포함된다. 사람 검토자는 품질 기준선을 정하지만, 튜토리얼은 작은 human-labeled set과 대조한 뒤에는 판정 모델이 반복 가능한 대역으로 작동할 수 있다고 설명했다.

OpenRouter는 LLM 판정 방식 3가지를 제시했다. pointwise scoring은 판정 모델에 후보 출력 1개와 rubric을 제공하며, 보통 CI에서 품질 기준값을 강제하거나 운영 샘플을 모니터링하는 데 쓴다. pairwise scoring은 출력 2개와 비교 rubric을 제공해 모델, 프롬프트, 에이전트 버전을 비교한다. reference-based scoring은 후보 출력, rubric, 신뢰할 수 있는 reference를 함께 제공해 검증된 자료 대비 사실 포괄성을 확인한다.

튜토리얼은 요구사항이 명확하지만 단일한 exact output이 아닌 경우, LLM 판정이 근거 기반 응답, 지시 준수, 완전성, 어조, 도구 사용 결과에 적합하다고 설명했다. 반대로 JSON의 schema validation, 산술용 calculator, 도구 인자와 side effect를 확인하는 unit test처럼 직접 검사가 가능한 경우에는 적합하지 않다고 했다. 중요한 차단 규칙은 결정론적으로 유지하고, 판정 모델은 최종 응답의 품질을 감사하는 역할을 맡을 수 있다.

OpenRouter의 Ori Eval은 Bun test runner로 TypeScript 파일 평가를 실행한다. 환불 예시에서 setupJudge({ minScore: 0.8 })는 별도 채점 에이전트를 만들고, run.tool(), run.toComplete(), autoEvals()는 도구 검증과 의미 기반 채점을 결합한다. 샘플 기준은 답변이 14-day refund window를 말하고, 직접 답하며, 지어낸 예외를 피하도록 요구한다. OpenRouter는 0.8 기준값이 시작점일 뿐이며 labeled responses에 맞춰 보정해야 한다고 밝혔다.

튜토리얼은 기준과 판정 모델을 고정한 채 같은 에이전트를 여러 후보 모델에서 실행하는 모델 비교도 보여줬다. candidateModels()는 OpenRouter의 live catalog에서 모델 slug를 반환할 수 있으며, limit: 5와 maxPromptPrice: 0.000005 같은 필터를 쓸 수 있다. 튜토리얼은 maxPromptPrice: 0.000005가 입력 토큰 100만 개당 5달러에 해당한다고 설명했다. 회귀 테스트의 경우 OpenRouter는 후보 모델 이름을 명시하고, 모델이 live 상태인지 확인하며, 각 결과와 함께 후보, 판정 모델, harness, rubric, 모델 파라미터, 테스트 데이터를 기록하라고 권고했다.

OpenRouter는 판정 신뢰도가 관찰 가능한 기준, 사람이 라벨링한 보정 예시, blind evaluation, 버전 관리된 rubric, variance tracking에 달려 있다고 설명했다. 또한 실제 에이전트 상호작용에서 나온 명확한 통과, 명확한 실패, 경계 사례를 포함한 데이터셋을 권고하고, 판정 모델이나 rubric, 평가 데이터가 바뀌면 보정을 반복하라고 했다. 튜토리얼은 LLM 판정이 평가 실행마다 모델 요청을 추가하므로 테스트 케이스, 후보 모델, rubric 차원 수에 따라 비용이 늘어난다고 설명했다. 이에 대한 통제책으로는 예약 평가, production-trace sampling, 초점이 좁은 judge call, 더 작은 후보 집합, 판정 모델에 필요한 context만 보내는 방식이 제시됐다.

OpenRouter는 9/14/2026 튜토리얼을 통해 개발자가 결정론적 테스트로 잡기 어려운 AI 에이전트 출력을 LLM-as-a-judge 평가로 채점하는 방법을 설명했다. 튜토리얼에 따르면 에이전트는 올바른 도구를 호출하고 정확한 정책을 가져와도, 최종 답변에서 환불 가능 기간을 빠뜨리는 식으로 불완전한 답을 낼 수 있다. LLM-as-a-judge는 두 번째 모델이 후보 에이전트의 사용자에게 보이는 출력을 쉬운 문장 기준과 대조해 점수를 내고, 점수가 선택한 기준값 아래로 떨어지면 평가 실패를 발생시켜 그 공백을 메운다.

OpenRouter는 후보 모델과 판정 모델을 구분했다. 후보 모델은 사용자에게 답하고 도구를 호출하며 테스트 대상 출력을 만들지만, 판정 모델은 과제를 직접 풀지 않고 후보가 이미 만든 결과만 채점한다. 튜토리얼은 가능하면 두 역할에 다른 모델을 쓰라고 권고하면서, Zheng 등 연구진이 self-enhancement, position, verbosity 편향을 확인한 2023년 논문 “Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena”를 인용했다. 또한 판정 모델에는 보이는 응답과 채점 기준에 필요한 도구 결과만 제공해야 하며, 숨겨진 추론은 보여주지 않아야 한다고 설명했다.

튜토리얼은 exact-match 검사, 결정론적 내용 검사, rubric 채점, 사람 검토를 나눴다. exact match는 정답 값이 정확히 1개인 경우에 맞고, Ori Eval의 run.toMention()은 주변 표현이 달라도 필수 문구가 등장하는지 확인한다. rubric은 사람이 적용할 수 있는 규칙으로 작성해야 하며, 예컨대 답변이 14-day refund window를 언급하고 지어낸 예외를 피하는지 같은 기준이 포함된다. 사람 검토자는 품질 기준선을 정하지만, 튜토리얼은 작은 human-labeled set과 대조한 뒤에는 판정 모델이 반복 가능한 대역으로 작동할 수 있다고 설명했다.

OpenRouter는 LLM 판정 방식 3가지를 제시했다. pointwise scoring은 판정 모델에 후보 출력 1개와 rubric을 제공하며, 보통 CI에서 품질 기준값을 강제하거나 운영 샘플을 모니터링하는 데 쓴다. pairwise scoring은 출력 2개와 비교 rubric을 제공해 모델, 프롬프트, 에이전트 버전을 비교한다. reference-based scoring은 후보 출력, rubric, 신뢰할 수 있는 reference를 함께 제공해 검증된 자료 대비 사실 포괄성을 확인한다.

튜토리얼은 요구사항이 명확하지만 단일한 exact output이 아닌 경우, LLM 판정이 근거 기반 응답, 지시 준수, 완전성, 어조, 도구 사용 결과에 적합하다고 설명했다. 반대로 JSON의 schema validation, 산술용 calculator, 도구 인자와 side effect를 확인하는 unit test처럼 직접 검사가 가능한 경우에는 적합하지 않다고 했다. 중요한 차단 규칙은 결정론적으로 유지하고, 판정 모델은 최종 응답의 품질을 감사하는 역할을 맡을 수 있다.

OpenRouter의 Ori Eval은 Bun test runner로 TypeScript 파일 평가를 실행한다. 환불 예시에서 setupJudge({ minScore: 0.8 })는 별도 채점 에이전트를 만들고, run.tool(), run.toComplete(), autoEvals()는 도구 검증과 의미 기반 채점을 결합한다. 샘플 기준은 답변이 14-day refund window를 말하고, 직접 답하며, 지어낸 예외를 피하도록 요구한다. OpenRouter는 0.8 기준값이 시작점일 뿐이며 labeled responses에 맞춰 보정해야 한다고 밝혔다.

튜토리얼은 기준과 판정 모델을 고정한 채 같은 에이전트를 여러 후보 모델에서 실행하는 모델 비교도 보여줬다. candidateModels()는 OpenRouter의 live catalog에서 모델 slug를 반환할 수 있으며, limit: 5와 maxPromptPrice: 0.000005 같은 필터를 쓸 수 있다. 튜토리얼은 maxPromptPrice: 0.000005가 입력 토큰 100만 개당 5달러에 해당한다고 설명했다. 회귀 테스트의 경우 OpenRouter는 후보 모델 이름을 명시하고, 모델이 live 상태인지 확인하며, 각 결과와 함께 후보, 판정 모델, harness, rubric, 모델 파라미터, 테스트 데이터를 기록하라고 권고했다.

OpenRouter는 판정 신뢰도가 관찰 가능한 기준, 사람이 라벨링한 보정 예시, blind evaluation, 버전 관리된 rubric, variance tracking에 달려 있다고 설명했다. 또한 실제 에이전트 상호작용에서 나온 명확한 통과, 명확한 실패, 경계 사례를 포함한 데이터셋을 권고하고, 판정 모델이나 rubric, 평가 데이터가 바뀌면 보정을 반복하라고 했다. 튜토리얼은 LLM 판정이 평가 실행마다 모델 요청을 추가하므로 테스트 케이스, 후보 모델, rubric 차원 수에 따라 비용이 늘어난다고 설명했다. 이에 대한 통제책으로는 예약 평가, production-trace sampling, 초점이 좁은 judge call, 더 작은 후보 집합, 판정 모델에 필요한 context만 보내는 방식이 제시됐다.

원문 보기 (영어)·2026년 9월 14일
#llm as a judge#openrouter#ori eval#ai agents#model evaluation#rubric scoring#mt bench#bun#candidate models#human labeled data