AI 비교AI 찾기AI 뉴스AI 활용
회사 소개
개인정보처리방침이용약관FAQ문의하기문의하기
에이아이비 주식회사사업자정보
© 2026 AIB Inc.

자가개선 에이전트 모델 실패

자가개선 에이전트 모델 실패

DEV.to·2026년 9월 5일 (토)
  • •4개 모델은 2개 릴리스와 4,150회 LLM 호출 뒤에도 승격 가능한 편집을 0건 만들었다
  • •Qwen3-4B, Mistral 24B, Qwen 30B, Llama 3.2-1B는 최종 정확도 향상을 보이지 않았다
  • •고살은 v0.3.0이 여러 후보를 만들고 저비용 평가 뒤 A/B test를 해야 한다고 말했다
  • •4개 모델은 2개 릴리스와 4,150회 LLM 호출 뒤에도 승격 가능한 편집을 0건 만들었다
  • •Qwen3-4B, Mistral 24B, Qwen 30B, Llama 3.2-1B는 최종 정확도 향상을 보이지 않았다
  • •고살은 v0.3.0이 여러 후보를 만들고 저비용 평가 뒤 A/B test를 해야 한다고 말했다
  • •4개 모델은 2개 릴리스와 4,150회 LLM 호출 뒤에도 승격 가능한 편집을 0건 만들었다
  • •Qwen3-4B, Mistral 24B, Qwen 30B, Llama 3.2-1B는 최종 정확도 향상을 보이지 않았다
  • •고살은 v0.3.0이 여러 후보를 만들고 저비용 평가 뒤 A/B test를 해야 한다고 말했다
  • •4개 모델은 2개 릴리스와 4,150회 LLM 호출 뒤에도 승격 가능한 편집을 0건 만들었다
  • •Qwen3-4B, Mistral 24B, Qwen 30B, Llama 3.2-1B는 최종 정확도 향상을 보이지 않았다
  • •고살은 v0.3.0이 여러 후보를 만들고 저비용 평가 뒤 A/B test를 해야 한다고 말했다

데바시시 고살(Debashish Ghosal)은 2026년 9월 3일, 자신의 자가개선 에이전트에서 4개 언어 모델이 2개 릴리스, 4,150회 LLM 호출, v0.1.0 버그 31건 해결, v0.2.0 이슈 26건 해결 이후에도 승격 가능한 프롬프트 편집을 만들지 못했다고 밝혔다. 테스트 대상은 Qwen3-4B-Instruct, Mistral Small 24B, Qwen 30B-A3B, Llama 3.2-1B였으며, 각 모델은 승격 가능한 편집 0건에 그쳤다. 고살은 병목이 모델 크기가 아니라 검색 전략에 있다고 판단했다.

모델 비교에서 최종 정확도 향상은 없었다. Qwen3-4B-Instruct는 기준선부터 최종까지 60%에 머물렀고 같은 편집 계열을 반복했다. Mistral Small 24B는 근접 변형을 탐색했지만 64%에 머물렀다. Qwen 30B-A3B도 64%였고, Mistral보다 약한 분석기로 설명됐다. Llama 3.2-1B는 36%에 머물렀으며 제안 자체를 만들지 못했다. Qwen 4B의 5회 반복에서 p-value는 0.73, 0.71, 0.46, 0.67, 1.0이었고 평균 변화량은 -0.05, -0.025, +0.025, -0.025, 0.0이었으며 정확도는 60%였다. Mistral 24B의 5회 반복에서 p-value는 0.55, 0.52, 1.0, 0.52, 0.77이었고 평균 변화량은 +0.025, +0.025, 0.0, +0.025, -0.025였으며 정확도는 64%였다. Mistral은 5회 중 3회에서 양의 변화량을 냈지만 p < 0.05를 넘지 못했다.

반복된 실패 패턴은 같은 국소 영역의 프롬프트 편집에 집중됐다. 모델들은 청구 관련 모호성 해소 규칙, “critical”과 “security”의 긴급성 표현, 쉼표로 구분한 레이블 같은 출력 형식 지시를 계속 수정했다. Mistral 24B는 보안 침해에 `active`를 추가하고, `only if critical to business continuity`를 넣고, `requires immediate intervention (e.g. ...)`를 더하는 변형을 시도했다. 그러나 고살은 3개 모두 “긴급이 보안보다 우선해야 한다”는 같은 편집 부류에 속한다고 말했다.

과제 결과는 범주별 약점이 안정적으로 반복됐음을 보여줬다. 단일 레이블 사례는 10/10 통과, 실패 0건이었다. 모호한 사례는 2/4 통과, 실패 2건이었는데 시스템이 항목을 `other` 대신 보안 또는 기술로 과분류했기 때문이다. 다중 레이블 사례는 0/3 통과, 실패 3건이었고, 시스템이 쉼표로 구분한 쌍 대신 단일 레이블을 반환했다. 경계 사례는 1/3 통과, 실패 2건으로, 정답이 청구 또는 `other`였을 때 기술을 선택했다. 레거시 사례는 3/5 통과, 실패 2건이었으며 다중 레이블과 경계 혼동이 원인이었다.

고살은 더 큰 모델을 좇느라 릴리스 1개를 낭비했다고 말했다. 앞선 테스트에는 10개 과제에서 정확도 80%를 낸 9B 모델과 같은 오류 2개를 보인 gpt-4o-mini 80%가 포함됐다. 이후 Mistral 24B는 방향성 있는 개선을 냈지만 승격되지 못했고, Qwen 30B는 더 느렸으며 개선이 없었고, Llama 3.2-1B는 제안을 만들지 못했다. 그는 제안 1개를 만들고 A/B test를 수행한 뒤 거부하고 반복하는 루프가 local optima(약한 해법 주변에 갇힘)를 벗어날 수 없다고 결론 내렸다.

통계적 기준도 승격을 제한했다. 40개 과제 A/B 말뭉치에서 모두 양수인 과제 변화 3건은 sign-test 하한 ~0.016을 만들었고, 과제 변화 5건 중 양수 4건과 음수 1건은 하한 ~0.031을 만들었다. p < 0.05를 안정적으로 넘으려면 분석기가 움직일 수 있는 과제 7-10개가 필요했지만, 실제로는 5개를 넘긴 적이 없었고 대부분의 편집은 2-3개만 움직였다. 고살은 v0.3.0이 다양한 후보를 여러 개 생성하고, 실패 묶음에서 저비용으로 점수화한 뒤, 가장 좋은 후보만 A/B test해야 한다고 말했다.

데바시시 고살(Debashish Ghosal)은 2026년 9월 3일, 자신의 자가개선 에이전트에서 4개 언어 모델이 2개 릴리스, 4,150회 LLM 호출, v0.1.0 버그 31건 해결, v0.2.0 이슈 26건 해결 이후에도 승격 가능한 프롬프트 편집을 만들지 못했다고 밝혔다. 테스트 대상은 Qwen3-4B-Instruct, Mistral Small 24B, Qwen 30B-A3B, Llama 3.2-1B였으며, 각 모델은 승격 가능한 편집 0건에 그쳤다. 고살은 병목이 모델 크기가 아니라 검색 전략에 있다고 판단했다.

모델 비교에서 최종 정확도 향상은 없었다. Qwen3-4B-Instruct는 기준선부터 최종까지 60%에 머물렀고 같은 편집 계열을 반복했다. Mistral Small 24B는 근접 변형을 탐색했지만 64%에 머물렀다. Qwen 30B-A3B도 64%였고, Mistral보다 약한 분석기로 설명됐다. Llama 3.2-1B는 36%에 머물렀으며 제안 자체를 만들지 못했다. Qwen 4B의 5회 반복에서 p-value는 0.73, 0.71, 0.46, 0.67, 1.0이었고 평균 변화량은 -0.05, -0.025, +0.025, -0.025, 0.0이었으며 정확도는 60%였다. Mistral 24B의 5회 반복에서 p-value는 0.55, 0.52, 1.0, 0.52, 0.77이었고 평균 변화량은 +0.025, +0.025, 0.0, +0.025, -0.025였으며 정확도는 64%였다. Mistral은 5회 중 3회에서 양의 변화량을 냈지만 p < 0.05를 넘지 못했다.

반복된 실패 패턴은 같은 국소 영역의 프롬프트 편집에 집중됐다. 모델들은 청구 관련 모호성 해소 규칙, “critical”과 “security”의 긴급성 표현, 쉼표로 구분한 레이블 같은 출력 형식 지시를 계속 수정했다. Mistral 24B는 보안 침해에 `active`를 추가하고, `only if critical to business continuity`를 넣고, `requires immediate intervention (e.g. ...)`를 더하는 변형을 시도했다. 그러나 고살은 3개 모두 “긴급이 보안보다 우선해야 한다”는 같은 편집 부류에 속한다고 말했다.

과제 결과는 범주별 약점이 안정적으로 반복됐음을 보여줬다. 단일 레이블 사례는 10/10 통과, 실패 0건이었다. 모호한 사례는 2/4 통과, 실패 2건이었는데 시스템이 항목을 `other` 대신 보안 또는 기술로 과분류했기 때문이다. 다중 레이블 사례는 0/3 통과, 실패 3건이었고, 시스템이 쉼표로 구분한 쌍 대신 단일 레이블을 반환했다. 경계 사례는 1/3 통과, 실패 2건으로, 정답이 청구 또는 `other`였을 때 기술을 선택했다. 레거시 사례는 3/5 통과, 실패 2건이었으며 다중 레이블과 경계 혼동이 원인이었다.

고살은 더 큰 모델을 좇느라 릴리스 1개를 낭비했다고 말했다. 앞선 테스트에는 10개 과제에서 정확도 80%를 낸 9B 모델과 같은 오류 2개를 보인 gpt-4o-mini 80%가 포함됐다. 이후 Mistral 24B는 방향성 있는 개선을 냈지만 승격되지 못했고, Qwen 30B는 더 느렸으며 개선이 없었고, Llama 3.2-1B는 제안을 만들지 못했다. 그는 제안 1개를 만들고 A/B test를 수행한 뒤 거부하고 반복하는 루프가 local optima(약한 해법 주변에 갇힘)를 벗어날 수 없다고 결론 내렸다.

통계적 기준도 승격을 제한했다. 40개 과제 A/B 말뭉치에서 모두 양수인 과제 변화 3건은 sign-test 하한 ~0.016을 만들었고, 과제 변화 5건 중 양수 4건과 음수 1건은 하한 ~0.031을 만들었다. p < 0.05를 안정적으로 넘으려면 분석기가 움직일 수 있는 과제 7-10개가 필요했지만, 실제로는 5개를 넘긴 적이 없었고 대부분의 편집은 2-3개만 움직였다. 고살은 v0.3.0이 다양한 후보를 여러 개 생성하고, 실패 묶음에서 저비용으로 점수화한 뒤, 가장 좋은 후보만 A/B test해야 한다고 말했다.

원문 보기 (영어)·2026년 9월 3일
#self improving agent#agentic ai#prompt editing#qwen3 4b#mistral 24b#qwen 30b#llama 3 2 1b#ab test#p value#sign test