AI 비교AI 찾기AI 뉴스AI 활용
회사 소개
개인정보처리방침이용약관FAQ문의하기문의하기
에이아이비 주식회사사업자정보
© 2026 AIB Inc.

AWS, Nova Forge 보상 설계 공개

AWS, Nova Forge 보상 설계 공개

AWS ML Blog·2026년 8월 15일 (토)
  • •AWS가 Amazon Nova Forge BYOO로 다중 턴 강화학습용 맞춤 보상 함수를 설계하는 방식을 설명했다
  • •Amazon Nova Lite 2.0 예시는 500개 작업과 4개 가중 보상 요소로 훈련했다
  • •AWS는 명확화 질문 비율이 약 34–96 percent로 올랐지만 정확도는 거의 변하지 않았다고 밝혔다
  • •AWS가 Amazon Nova Forge BYOO로 다중 턴 강화학습용 맞춤 보상 함수를 설계하는 방식을 설명했다
  • •Amazon Nova Lite 2.0 예시는 500개 작업과 4개 가중 보상 요소로 훈련했다
  • •AWS는 명확화 질문 비율이 약 34–96 percent로 올랐지만 정확도는 거의 변하지 않았다고 밝혔다
  • •AWS가 Amazon Nova Forge BYOO로 다중 턴 강화학습용 맞춤 보상 함수를 설계하는 방식을 설명했다
  • •Amazon Nova Lite 2.0 예시는 500개 작업과 4개 가중 보상 요소로 훈련했다
  • •AWS는 명확화 질문 비율이 약 34–96 percent로 올랐지만 정확도는 거의 변하지 않았다고 밝혔다
  • •AWS가 Amazon Nova Forge BYOO로 다중 턴 강화학습용 맞춤 보상 함수를 설계하는 방식을 설명했다
  • •Amazon Nova Lite 2.0 예시는 500개 작업과 4개 가중 보상 요소로 훈련했다
  • •AWS는 명확화 질문 비율이 약 34–96 percent로 올랐지만 정확도는 거의 변하지 않았다고 밝혔다

AWS는 2026년 8월 14일 Amazon Nova Forge에서 다중 턴 강화학습용 맞춤 보상 함수를 설계하는 방법을 설명한 가이드를 공개했다. 가이드는 보상 함수가 Amazon Nova 모델이 무엇을 학습할지 결정하며, 훈련 곡선이 정상처럼 보여도 미묘하게 잘못된 보상은 원치 않는 행동을 가르칠 수 있다고 밝혔다. 다중 턴 훈련에서 Nova Forge는 Bring Your Own Orchestration(BYOO)을 통해 고객 관리 환경에서 보상 로직을 실행할 수 있으며, 해당 환경을 관리하고 싶지 않은 팀을 위한 서버리스 다중 턴 RL 옵션도 현재 일반 제공된다.

Amazon Nova Forge는 강화 파인튜닝(RFT)을 지원한다. RFT는 주석이 달린 추론 경로가 포함된 선별 예시가 아니라, 모델 자신의 출력에 대한 평가 신호에서 학습한다. 다중 턴 RFT는 도구 호출, 코드 실행, 실수 복구처럼 여러 단계에 걸쳐 행동하는 에이전트로 이 과정을 확장하며, 전체 궤적의 누적 보상을 최적화한다. 가이드는 Nova Forge가 Group Relative Policy Optimization(GRPO)을 사용한다고 설명했다. GRPO는 각 대화에 대해 K개 롤아웃을 순위화하고, advantage라고도 부르는 정규화 보상으로 모델을 업데이트한다.

가이드는 단일 턴과 다중 턴 보상 실행을 구분했다. 단일 턴 RFT는 reward_lambda_arn을 통해 보상을 AWS Lambda 함수로 등록할 수 있지만, 다중 턴 대화와 장시간 점수 산정은 Lambda의 15분 호출 제한을 넘을 수 있다. BYOO 경로에서 개발자는 rollout.delegate: true를 설정하고, 예컨대 Amazon ECS의 컨테이너에서 보상 환경을 실행한다. 컨테이너는 대화 상태, 사용자 시뮬레이션, 코드 실행, 검증을 관리한 뒤 aggregate_reward_score와 선택적 구성 요소 점수를 metrics_list로 반환한다.

AWS는 결과 보상, 행동 보상, 페널티를 결합한 다중 턴 보상을 권장했다. 단일 스칼라 보상은 악용되기 쉽고, 최종 결과만 보는 보상은 훈련 초기에 지나치게 희소할 수 있기 때문이다. 실습 예시는 GRPO, Low-Rank Adaptation(LoRA), Amazon SageMaker HyperPod, 고객 관리 BYOO 컨테이너를 사용해 Amazon Nova Lite 2.0을 500개 고유 프로그래밍 작업으로 훈련한다. 작업은 모델에 불완전한 코딩 요청을 주고, 사용자 시뮬레이터는 전체 명세를 비공개로 보유한 채 모델이 질문할 때만 세부 정보를 드러낸다.

예시 보상은 4개 가중 요소를 쓴다. correctness는 1.0이며 숨겨진 단위 테스트 통과 비율로 측정된다. asked_before_coding은 0.6이며 모델이 1번째 턴에 질문한 뒤 커밋하면 1.0, 나중에 질문한 뒤 커밋하면 0.6, 그 외에는 0을 준다. guessed_immediately는 0.4이며 첫 턴이 질문 없는 코드이면 -1.0을 적용한다. loop_penalty는 0.2이며 마지막 두 턴이 80% 넘게 유사하면 -0.5를 적용한다. AWS는 원하는 행동은 직접 보상 가능해야 하고, 실패 모드는 명시적으로 벌점을 받아야 GRPO가 그룹 내 보상 변화를 볼 수 있다고 밝혔다.

가이드는 RL에서 모델이 생성한 코드를 검증되지 않은 것으로 취급해야 한다고 경고했다. AWS는 자격 증명이나 네트워크 접근을 노출하지 말고, 리소스 제한을 적용하며, 임시 디렉터리에서 코드를 실행하고, 모델이 예상 stderr 마커를 위조하지 못하도록 실행마다 무작위 sentinel을 쓰며, 더 강한 격리가 필요할 때 전용 샌드박스를 호출하라고 권고했다. 또한 하네스는 실제 실행된 테스트 수를 예상 테스트 수와 대조해 검증해야 하며, 그래야 모델이 쉽게 통과하는 테스트로 점수를 희석하지 못한다고 설명했다.

AWS는 reward collapse를 그룹 내 변화가 사라져 학습이 조용히 멈추는 실패 모드로 설명했다. 이때도 총보상, 손실, 완료 길이 곡선은 정상처럼 보일 수 있다. 이전 버전에서는 질문 보너스가 정확도 뒤에 묶여 있었고, 효율성 항목은 더 짧은 대화를 보상했다. 어려운 작업에서 정확도는 거의 0에 가까웠고, 질문 보너스는 드물게 작동했으며, 턴 수를 줄이는 것이 최선 전략이 됐다. 결국 모델은 1번째 턴에 추측하는 방향으로 수렴했고, 평균 보상은 멈췄으며 GRPO advantage는 0이 됐다.

두 번째 collapse는 하네스가 모델 출력을 실행하지 않아 correctness 점수기가 모든 롤아웃에 같은 값을 반환하면서 발생했다. 이런 문제는 진입점 이름 불일치, import 실패, 설정 오류에서 생길 수 있다. AWS는 모델의 명확화 질문 비율이 약 34–96 percent로 상승했지만, 점수기가 상수였기 때문에 코드 정확도는 거의 변하지 않았다고 밝혔다. 가이드는 각 보상 구성 요소의 그룹 내 표준편차와 GRPO에 대한 기여도를 추적하라고 권고했다.

AWS는 2026년 8월 14일 Amazon Nova Forge에서 다중 턴 강화학습용 맞춤 보상 함수를 설계하는 방법을 설명한 가이드를 공개했다. 가이드는 보상 함수가 Amazon Nova 모델이 무엇을 학습할지 결정하며, 훈련 곡선이 정상처럼 보여도 미묘하게 잘못된 보상은 원치 않는 행동을 가르칠 수 있다고 밝혔다. 다중 턴 훈련에서 Nova Forge는 Bring Your Own Orchestration(BYOO)을 통해 고객 관리 환경에서 보상 로직을 실행할 수 있으며, 해당 환경을 관리하고 싶지 않은 팀을 위한 서버리스 다중 턴 RL 옵션도 현재 일반 제공된다.

Amazon Nova Forge는 강화 파인튜닝(RFT)을 지원한다. RFT는 주석이 달린 추론 경로가 포함된 선별 예시가 아니라, 모델 자신의 출력에 대한 평가 신호에서 학습한다. 다중 턴 RFT는 도구 호출, 코드 실행, 실수 복구처럼 여러 단계에 걸쳐 행동하는 에이전트로 이 과정을 확장하며, 전체 궤적의 누적 보상을 최적화한다. 가이드는 Nova Forge가 Group Relative Policy Optimization(GRPO)을 사용한다고 설명했다. GRPO는 각 대화에 대해 K개 롤아웃을 순위화하고, advantage라고도 부르는 정규화 보상으로 모델을 업데이트한다.

가이드는 단일 턴과 다중 턴 보상 실행을 구분했다. 단일 턴 RFT는 reward_lambda_arn을 통해 보상을 AWS Lambda 함수로 등록할 수 있지만, 다중 턴 대화와 장시간 점수 산정은 Lambda의 15분 호출 제한을 넘을 수 있다. BYOO 경로에서 개발자는 rollout.delegate: true를 설정하고, 예컨대 Amazon ECS의 컨테이너에서 보상 환경을 실행한다. 컨테이너는 대화 상태, 사용자 시뮬레이션, 코드 실행, 검증을 관리한 뒤 aggregate_reward_score와 선택적 구성 요소 점수를 metrics_list로 반환한다.

AWS는 결과 보상, 행동 보상, 페널티를 결합한 다중 턴 보상을 권장했다. 단일 스칼라 보상은 악용되기 쉽고, 최종 결과만 보는 보상은 훈련 초기에 지나치게 희소할 수 있기 때문이다. 실습 예시는 GRPO, Low-Rank Adaptation(LoRA), Amazon SageMaker HyperPod, 고객 관리 BYOO 컨테이너를 사용해 Amazon Nova Lite 2.0을 500개 고유 프로그래밍 작업으로 훈련한다. 작업은 모델에 불완전한 코딩 요청을 주고, 사용자 시뮬레이터는 전체 명세를 비공개로 보유한 채 모델이 질문할 때만 세부 정보를 드러낸다.

예시 보상은 4개 가중 요소를 쓴다. correctness는 1.0이며 숨겨진 단위 테스트 통과 비율로 측정된다. asked_before_coding은 0.6이며 모델이 1번째 턴에 질문한 뒤 커밋하면 1.0, 나중에 질문한 뒤 커밋하면 0.6, 그 외에는 0을 준다. guessed_immediately는 0.4이며 첫 턴이 질문 없는 코드이면 -1.0을 적용한다. loop_penalty는 0.2이며 마지막 두 턴이 80% 넘게 유사하면 -0.5를 적용한다. AWS는 원하는 행동은 직접 보상 가능해야 하고, 실패 모드는 명시적으로 벌점을 받아야 GRPO가 그룹 내 보상 변화를 볼 수 있다고 밝혔다.

가이드는 RL에서 모델이 생성한 코드를 검증되지 않은 것으로 취급해야 한다고 경고했다. AWS는 자격 증명이나 네트워크 접근을 노출하지 말고, 리소스 제한을 적용하며, 임시 디렉터리에서 코드를 실행하고, 모델이 예상 stderr 마커를 위조하지 못하도록 실행마다 무작위 sentinel을 쓰며, 더 강한 격리가 필요할 때 전용 샌드박스를 호출하라고 권고했다. 또한 하네스는 실제 실행된 테스트 수를 예상 테스트 수와 대조해 검증해야 하며, 그래야 모델이 쉽게 통과하는 테스트로 점수를 희석하지 못한다고 설명했다.

AWS는 reward collapse를 그룹 내 변화가 사라져 학습이 조용히 멈추는 실패 모드로 설명했다. 이때도 총보상, 손실, 완료 길이 곡선은 정상처럼 보일 수 있다. 이전 버전에서는 질문 보너스가 정확도 뒤에 묶여 있었고, 효율성 항목은 더 짧은 대화를 보상했다. 어려운 작업에서 정확도는 거의 0에 가까웠고, 질문 보너스는 드물게 작동했으며, 턴 수를 줄이는 것이 최선 전략이 됐다. 결국 모델은 1번째 턴에 추측하는 방향으로 수렴했고, 평균 보상은 멈췄으며 GRPO advantage는 0이 됐다.

두 번째 collapse는 하네스가 모델 출력을 실행하지 않아 correctness 점수기가 모든 롤아웃에 같은 값을 반환하면서 발생했다. 이런 문제는 진입점 이름 불일치, import 실패, 설정 오류에서 생길 수 있다. AWS는 모델의 명확화 질문 비율이 약 34–96 percent로 상승했지만, 점수기가 상수였기 때문에 코드 정확도는 거의 변하지 않았다고 밝혔다. 가이드는 각 보상 구성 요소의 그룹 내 표준편차와 GRPO에 대한 기여도를 추적하라고 권고했다.

원문 보기 (영어)·2026년 8월 14일
인프라#amazon nova forge#multi turn rl#reinforcement fine tuning#grpo#byoo#amazon nova lite 2 0#reward functions#sagemaker hyperpod#lora#aws