AI 비교AI 찾기AI 뉴스AI 활용
회사 소개
개인정보처리방침이용약관FAQ문의하기문의하기
에이아이비 주식회사사업자정보
© 2026 AIB Inc.

Cohere, 60개 언어로 추론하는 소형 모델 훈련

Cohere, 60개 언어로 추론하는 소형 모델 훈련

Cohere·2026년 10월 7일 (수)
  • •Tiny Aya L2-Thinker, 60개 언어에서 사용자 언어로 93% 넘게 추론
  • •영어 추론·44개 언어 번역 예시·추론 흔적 없는 다국어 답변 자료를 결합해 훈련
  • •언어 자원 수준별 추론 비율은 99%, 99%, 94.3%, 94.5%; PolyMath 정확도는 더 크게 하락
  • •Tiny Aya L2-Thinker, 60개 언어에서 사용자 언어로 93% 넘게 추론
  • •영어 추론·44개 언어 번역 예시·추론 흔적 없는 다국어 답변 자료를 결합해 훈련
  • •언어 자원 수준별 추론 비율은 99%, 99%, 94.3%, 94.5%; PolyMath 정확도는 더 크게 하락
  • •Tiny Aya L2-Thinker, 60개 언어에서 사용자 언어로 93% 넘게 추론
  • •영어 추론·44개 언어 번역 예시·추론 흔적 없는 다국어 답변 자료를 결합해 훈련
  • •언어 자원 수준별 추론 비율은 99%, 99%, 94.3%, 94.5%; PolyMath 정확도는 더 크게 하락
  • •Tiny Aya L2-Thinker, 60개 언어에서 사용자 언어로 93% 넘게 추론
  • •영어 추론·44개 언어 번역 예시·추론 흔적 없는 다국어 답변 자료를 결합해 훈련
  • •언어 자원 수준별 추론 비율은 99%, 99%, 94.3%, 94.5%; PolyMath 정확도는 더 크게 하락

Cohere 연구진은 33억 5,000만 개 매개변수를 가진 Tiny Aya L2-Thinker를 훈련해 사용자가 질문에 쓴 언어로 추론하도록 했습니다. 모델은 60개 언어에서 93% 넘는 경우 해당 언어로 추론 흔적을 생성했고, 비슷한 모델보다 정확도 손실과 추론 토큰 사용량이 적었습니다. Cohere는 후속 연구를 지원하기 위해 Hugging Face에 모델 가중치와 다국어 추론 데이터를 공개했습니다.

연구진은 영어 중심 추론이 내부 번역 과정에서 뉘앙스를 잃고, 다른 언어로 표현된 문화 지식을 활용하지 못할 수 있다고 설명했습니다. 영어를 모르는 사람은 추론 흔적을 살펴보기도 어렵습니다. 사용자의 언어로 하는 추론, 즉 L2 추론은 답변에 이르는 단계를 읽고 확인해 오류를 찾게 합니다. 행운으로 여겨지는 일을 묻는 힌디어 질문 사례에서 Tiny Aya L2-Thinker는 힌디어로 인도 미신을 고려해 정답을 냈지만, 영어 추론 예시는 선택지를 따져 보지 않은 채 서구 중심의 답을 내놓았습니다.

연구진은 문맥 길이가 32K인 Tiny Aya Base를 바탕으로 세 종류의 훈련 데이터를 혼합했습니다. 첫째, gpt-oss-120b가 생성한 약 170만 개의 영어 단계별 추론 예시는 특히 수학 문제 해결을 가르쳤지만, 이것만 사용했을 때 질문 언어로 추론한 비율은 12.8%였습니다. 둘째, 44개 언어마다 약 5,000개씩 마련한 다국어 추론 번역 예시는 그 비율을 86.1%로 높였고 정확도도 개선했습니다. 셋째, 추론 흔적 없이 질문과 답만 담은 다국어 자료는 추론 예시가 없는 언어로도 해당 언어 추론을 확장하도록 도왔습니다.

연구진은 수학, 문화·상식 추론, 지시 따르기, 자유 형식 글쓰기를 다루는 6개 벤치마크로 60개 언어 성능을 평가했습니다. 6개 중 5개에서는 영어 추론 모델과 비교해 정확도가 최대 2~3포인트 하락했고, 자유 형식 글쓰기 성능은 소폭 올랐습니다. 예외인 대회 수준 수학 벤치마크 PolyMath에서는 정확도가 더 크게 떨어졌습니다. 연구진은 어려운 수학 문제와 번역된 훈련 추론 흔적의 문제를 개선하는 데 도움이 될 수 있는 강화학습을 모델에 적용하지 않은 점이 일부 원인이라고 설명했습니다.

언어 자원 수준을 네 단계로 나눴을 때 Tiny Aya L2-Thinker의 해당 언어 추론 비율은 상위 두 단계에서 각각 99%, 하위 두 단계에서 94.3%와 94.5%였습니다. Magistral은 72%에서 5%로 떨어졌고, M-Thinker는 여러 지표에서 약해졌으며 추론 흔적 길이는 대략 두 배가 됐습니다. Tiny Aya는 평균적으로 사고 토큰을 5,000개 미만 사용했습니다. 연구진은 긴 추론 흔적이 텍스트를 반복하거나 답 없이 순환하는 사례도 확인했으며, Qwen3.5-4B는 보통 10,000~25,000개 토큰을 사용했습니다. 연구진은 추론 능력과 추론 언어를 따로 학습할 수 있다고 밝혔으며, 의미 있고 해석 가능한 추론 흔적을 만드는 일은 앞으로 더 연구해야 한다고 덧붙였습니다.

Cohere 연구진은 33억 5,000만 개 매개변수를 가진 Tiny Aya L2-Thinker를 훈련해 사용자가 질문에 쓴 언어로 추론하도록 했습니다. 모델은 60개 언어에서 93% 넘는 경우 해당 언어로 추론 흔적을 생성했고, 비슷한 모델보다 정확도 손실과 추론 토큰 사용량이 적었습니다. Cohere는 후속 연구를 지원하기 위해 Hugging Face에 모델 가중치와 다국어 추론 데이터를 공개했습니다.

연구진은 영어 중심 추론이 내부 번역 과정에서 뉘앙스를 잃고, 다른 언어로 표현된 문화 지식을 활용하지 못할 수 있다고 설명했습니다. 영어를 모르는 사람은 추론 흔적을 살펴보기도 어렵습니다. 사용자의 언어로 하는 추론, 즉 L2 추론은 답변에 이르는 단계를 읽고 확인해 오류를 찾게 합니다. 행운으로 여겨지는 일을 묻는 힌디어 질문 사례에서 Tiny Aya L2-Thinker는 힌디어로 인도 미신을 고려해 정답을 냈지만, 영어 추론 예시는 선택지를 따져 보지 않은 채 서구 중심의 답을 내놓았습니다.

연구진은 문맥 길이가 32K인 Tiny Aya Base를 바탕으로 세 종류의 훈련 데이터를 혼합했습니다. 첫째, gpt-oss-120b가 생성한 약 170만 개의 영어 단계별 추론 예시는 특히 수학 문제 해결을 가르쳤지만, 이것만 사용했을 때 질문 언어로 추론한 비율은 12.8%였습니다. 둘째, 44개 언어마다 약 5,000개씩 마련한 다국어 추론 번역 예시는 그 비율을 86.1%로 높였고 정확도도 개선했습니다. 셋째, 추론 흔적 없이 질문과 답만 담은 다국어 자료는 추론 예시가 없는 언어로도 해당 언어 추론을 확장하도록 도왔습니다.

연구진은 수학, 문화·상식 추론, 지시 따르기, 자유 형식 글쓰기를 다루는 6개 벤치마크로 60개 언어 성능을 평가했습니다. 6개 중 5개에서는 영어 추론 모델과 비교해 정확도가 최대 2~3포인트 하락했고, 자유 형식 글쓰기 성능은 소폭 올랐습니다. 예외인 대회 수준 수학 벤치마크 PolyMath에서는 정확도가 더 크게 떨어졌습니다. 연구진은 어려운 수학 문제와 번역된 훈련 추론 흔적의 문제를 개선하는 데 도움이 될 수 있는 강화학습을 모델에 적용하지 않은 점이 일부 원인이라고 설명했습니다.

언어 자원 수준을 네 단계로 나눴을 때 Tiny Aya L2-Thinker의 해당 언어 추론 비율은 상위 두 단계에서 각각 99%, 하위 두 단계에서 94.3%와 94.5%였습니다. Magistral은 72%에서 5%로 떨어졌고, M-Thinker는 여러 지표에서 약해졌으며 추론 흔적 길이는 대략 두 배가 됐습니다. Tiny Aya는 평균적으로 사고 토큰을 5,000개 미만 사용했습니다. 연구진은 긴 추론 흔적이 텍스트를 반복하거나 답 없이 순환하는 사례도 확인했으며, Qwen3.5-4B는 보통 10,000~25,000개 토큰을 사용했습니다. 연구진은 추론 능력과 추론 언어를 따로 학습할 수 있다고 밝혔으며, 의미 있고 해석 가능한 추론 흔적을 만드는 일은 앞으로 더 연구해야 한다고 덧붙였습니다.

원문 보기 (영어)·2026년 10월 6일
#cohere#tiny aya l2 thinker#multilingual reasoning#in language reasoning#data mixing#reasoning traces#hugging face#low resource languages