性能・品質
やや否定的コーディングやエージェントタスクでの優れたベンチマークスコアが注目される一方、極端に遅い生成速度、ツール呼び出しのバグ、推論に必要な重いハードウェア要件、テスト結果に見合わない実運用の質の低さなどが批判されています。
MiMo-V2.6-Proは、Xiaomiが開発したオープンウェイト(モデルの構造や設定値が公開された)の基盤モデルであり、現場での自動化ワークフローや複雑な問題解決に向けて作られています。テキスト、画像、動画、音声を入力として受け取って文章で回答でき、本1冊分に相当する長大な文書も一度にまとめて処理することが可能です。唐突に答えを出すのではなく、順を追って段階的に考えを進めたり、外部のツールと連携したり、導き出した結果をJSONのような整理された形式に整えて出力したりできます。実際の開発現場では、システム設計案の作成、プロジェクトの進め方の計画、プログラムの不具合修正をはじめ、1回の指示からデザインが整ったWebページや3D対応のWebアプリを丸ごと生成するといったソフトウェア開発作業に対応します。
このモデルは、手頃なコストで自前のサーバーに導入(セルフホスト)し、複数ステップにわたるソフトウェア作業を自律的に進めたい開発者や組織に適しています。従来の基準となるMiMo-V2.5と比べて複数の課題を同時にこなす枠組みを重視して学習されており、兄弟モデルのMiMo-V2.6-Flashよりも多くの計算資源を投入して長時間の学習が行われました。一方でXiaomiは、未知の環境における処理能力の限界やシステム全体の安定性については、今後も継続的な検証と改善が必要であるとしています。
出典・最終更新日は各評価指標の詳細ページで確認できますデータの出典・掲載停止のご依頼
Xiaomiのオープンウェイトの透明性やDeepSeekなどの競合に対する価格競争力は高く評価されているものの、動作の遅さやツールの不具合、実用性に欠けるレイテンシに対する不満の声も上がっています。
コーディングやエージェントタスクでの優れたベンチマークスコアが注目される一方、極端に遅い生成速度、ツール呼び出しのバグ、推論に必要な重いハードウェア要件、テスト結果に見合わない実運用の質の低さなどが批判されています。
低価格やGPT-5.6 SolおよびOpus 5に匹敵するベンチマークスコアは称賛されているものの、実際のワークフローではDeepSeek-V4.1 Flashと比べて大幅に遅く、信頼性に欠けると感じるユーザーが多くいます。
XiaomiによるとMiMo v2.6のトレーニング費用は347万ドルだったとのこと。大手5社(MSL、xAI、GDM、OAI、Ant)の推定費用(1億ドル以上)とは雲泥の差です。給与や研究開発費でも同様に劇的な差があっても不思議ではありません。ベンチマークでMuse Spark 1.3に匹敵するモデルでありながら、キャッシュレートが100万トークンあたり0.0036ドルに据え置かれることを考えると、MiMo v2.6 Proは信じられないほど安価です。
“Per Xiaomi, MiMo v2.6 training run cost $3.47m. A far cry from the estimated costs ($100m+) for the Big 5 (MSL, xAI, GDM, OAI, Ant). I wouldn't be surprised if salaries and R&D costs have similar drastic disparities. For a model that matches Muse Spark 1.3 in benchmarks, MiMo v2.6 Pro is incredibly cheap, given its cache rates will remain $0.0036 per million.”
✨ MiMo-V2.6 Pro RL: 最大限の能力 - 1.02T / 42B - 強力なコーディング+エージェント性能: 71.9 DeepSWE / 53.1 AutomationBench / 89.9 Terminal Bench 2.1 ✨ MiMo-V2.6 Flash RL: 最大限の効率性 - 309B / 15B - 15Bのアクティブパラメータでありながら、多くのエージェントベンチマークでProに迫る性能
“✨ MiMo- V2.6 Pro RL: Maximum capability - 1.02T / 42B - Strong coding + agent performance: 71.9 DeepSWE / 53.1 AutomationBench / 89.9 Terminal Bench 2.1 ✨ MiMo-V2.6 Flash RL: Maximum efficiency - 309B / 15B - 15B active params while staying close to Pro on many agent benchmarks”
2.6-proがステップ10で63.7%に達し、現在はステップ11です。flashですらステップ12で60.7%に達し、今はステップ16です。めちゃくちゃ熱い展開ですね(笑)。
“2.6-pro just reached 63.7% by step 10, it's on step 11 right now. Even flash reached 60.7% by step 12, and it's on step 16 now. This is so exciting lmao.”
Xiaomi Mimo-v2.6 Pro & Flashは、比較的無名のラボ出身でありながらSolやFableと並んでエージェントベンチマークで圧倒的な結果を出しています。それぞれ524B / 159Bのオープンウェイト。画像、動画、音声対応 mimo.xiaomi.com/mimo-v2-6
“Xiaomi Mimo-v2.6 Pro & Flash Nails the agent benchmarks alongside Sol & Fable, but from a relatively unknown lab. 524B / 159B respectively Open weights. Image, Video & Audio mimo.xiaomi.com/mimo-v2-6”
彼らの素晴らしいところは、直面したあらゆる挫折をオープンにした点です。再起動の理由をすべて記録し、コーディングのベンチマークを低下させたサイバーデータセットを除外した経緯も語っています。さらにリアルタイムのトレーニング損失、各チェックポイント後のベンチマークスコア、運用コストの見積もりも公開しました。唯一足りなかったのはデータセットの説明くらいで、ダッシュボードには「dataset-zrso」のようなランダムなIDしかありませんでした。おそらく法務チームの都合でしょう。
“The best thing they did is being open about all the setbacks they had to deal with. They logged every restart with a reason, talked about dropping a cyber dataset after it degraded coding benchmarks. Also published real time training loss, benchmark scores after every checkpoint and running cost estimates. Really the only thing missing was dataset descriptions, the dashboard only had random IDs like "dataset-zrso". I guess it's their lawyers fault.”
月額200ドルのサブスクで使っていたSol 5.6 xhighは、コーディング作業で非常に頼れる相棒でした。しかし今週システムが調整されたらしく、週の利用上限に達していないにもかかわらず、すべてのモデル(Astra、Sol、Luna)で頻繁にレート制限にかかるようになってしまいました。MiMo 2.6proの初期結果はUI以外の作業でかなり有望なので、当面は課金先を乗り換えようと思います。
“Sol 5.6 xhigh had been a very reliable workhorse for coding for me via the 200 bucks sub. But this week they seem to have tweaked the system to a point at which all models (Astra, Sol, Luna) hit rate limits all_the_time without me being anywhere close to the weekly limit. Early results with MiMo 2.6pro are quite encouraging for anything that's non-UI work so likely switching spend for the time being”
みんなが知りたがっているスペックについて:ベンチマーク上ではMiMo-V2.6-Flash-310B-A15BがおおよそGPT-5.6 Luna / Claude 4.9相当、MiMo-V2.6-Pro-1.02T-A42BがおおよそGPT-5.6 Sol / Opus 5相当です。もしかするとIQ2なら、flashは128G M5で動くかもしれませんね?
“As for the stats that everyone wants: MiMo-V2.6-Flash-310B-A15B roughly GPT-5.6 Luna / Claude 4.9 according to benchmarks MiMo-V2.6-Pro-1.02T-A42B roughly GPT-5.6 Sol / Opus 5 according to benchmarks Perhaps with IQ2 flash will run on 128G M5?”
Kimiの推論と比べると、レスポンス速度が文字通り桁違いに速いです。
“you're definitely a metric fuckload (scientific term) faster with responses than on Kimi's inferencing”
huggingface.co/XiaomiMiMo/M... MiMo-V2.6がリリースされました!そして個人的にそれ以上に重要なのが技術レポートです。最新のフロンティアモデルの技術レポートとしては、これまでで最も充実した内容になっています。本当に素晴らしいです。
“huggingface.co/XiaomiMiMo/M... MiMo-V2.6 is out! and, more importantly to me, the tech report. this is the most batteries-included tech report for a modern frontier model ever. really cool stuff.”
MiMo V2.5自体普通にDeepSeekV4Flash 0731より強い場面は明確にあったし、ループ問題細なければ・・・ って感じだったけど、これ覚醒してそうだな。
XiaomiによるとMiMo v2.6のトレーニング費用は347万ドルだったとのこと。大手5社(MSL、xAI、GDM、OAI、Ant)の推定費用(1億ドル以上)とは雲泥の差です。給与や研究開発費でも同様に劇的な差があっても不思議ではありません。ベンチマークでMuse Spark 1.3に匹敵するモデルでありながら、キャッシュレートが100万トークンあたり0.0036ドルに据え置かれることを考えると、MiMo v2.6 Proは信じられないほど安価です。
“Per Xiaomi, MiMo v2.6 training run cost $3.47m. A far cry from the estimated costs ($100m+) for the Big 5 (MSL, xAI, GDM, OAI, Ant). I wouldn't be surprised if salaries and R&D costs have similar drastic disparities. For a model that matches Muse Spark 1.3 in benchmarks, MiMo v2.6 Pro is incredibly cheap, given its cache rates will remain $0.0036 per million.”
✨ MiMo-V2.6 Pro RL: 最大限の能力 - 1.02T / 42B - 強力なコーディング+エージェント性能: 71.9 DeepSWE / 53.1 AutomationBench / 89.9 Terminal Bench 2.1 ✨ MiMo-V2.6 Flash RL: 最大限の効率性 - 309B / 15B - 15Bのアクティブパラメータでありながら、多くのエージェントベンチマークでProに迫る性能
“✨ MiMo- V2.6 Pro RL: Maximum capability - 1.02T / 42B - Strong coding + agent performance: 71.9 DeepSWE / 53.1 AutomationBench / 89.9 Terminal Bench 2.1 ✨ MiMo-V2.6 Flash RL: Maximum efficiency - 309B / 15B - 15B active params while staying close to Pro on many agent benchmarks”
2.6-proがステップ10で63.7%に達し、現在はステップ11です。flashですらステップ12で60.7%に達し、今はステップ16です。めちゃくちゃ熱い展開ですね(笑)。
“2.6-pro just reached 63.7% by step 10, it's on step 11 right now. Even flash reached 60.7% by step 12, and it's on step 16 now. This is so exciting lmao.”
Xiaomi Mimo-v2.6 Pro & Flashは、比較的無名のラボ出身でありながらSolやFableと並んでエージェントベンチマークで圧倒的な結果を出しています。それぞれ524B / 159Bのオープンウェイト。画像、動画、音声対応 mimo.xiaomi.com/mimo-v2-6
“Xiaomi Mimo-v2.6 Pro & Flash Nails the agent benchmarks alongside Sol & Fable, but from a relatively unknown lab. 524B / 159B respectively Open weights. Image, Video & Audio mimo.xiaomi.com/mimo-v2-6”
彼らの素晴らしいところは、直面したあらゆる挫折をオープンにした点です。再起動の理由をすべて記録し、コーディングのベンチマークを低下させたサイバーデータセットを除外した経緯も語っています。さらにリアルタイムのトレーニング損失、各チェックポイント後のベンチマークスコア、運用コストの見積もりも公開しました。唯一足りなかったのはデータセットの説明くらいで、ダッシュボードには「dataset-zrso」のようなランダムなIDしかありませんでした。おそらく法務チームの都合でしょう。
“The best thing they did is being open about all the setbacks they had to deal with. They logged every restart with a reason, talked about dropping a cyber dataset after it degraded coding benchmarks. Also published real time training loss, benchmark scores after every checkpoint and running cost estimates. Really the only thing missing was dataset descriptions, the dashboard only had random IDs like "dataset-zrso". I guess it's their lawyers fault.”
月額200ドルのサブスクで使っていたSol 5.6 xhighは、コーディング作業で非常に頼れる相棒でした。しかし今週システムが調整されたらしく、週の利用上限に達していないにもかかわらず、すべてのモデル(Astra、Sol、Luna)で頻繁にレート制限にかかるようになってしまいました。MiMo 2.6proの初期結果はUI以外の作業でかなり有望なので、当面は課金先を乗り換えようと思います。
“Sol 5.6 xhigh had been a very reliable workhorse for coding for me via the 200 bucks sub. But this week they seem to have tweaked the system to a point at which all models (Astra, Sol, Luna) hit rate limits all_the_time without me being anywhere close to the weekly limit. Early results with MiMo 2.6pro are quite encouraging for anything that's non-UI work so likely switching spend for the time being”
みんなが知りたがっているスペックについて:ベンチマーク上ではMiMo-V2.6-Flash-310B-A15BがおおよそGPT-5.6 Luna / Claude 4.9相当、MiMo-V2.6-Pro-1.02T-A42BがおおよそGPT-5.6 Sol / Opus 5相当です。もしかするとIQ2なら、flashは128G M5で動くかもしれませんね?
“As for the stats that everyone wants: MiMo-V2.6-Flash-310B-A15B roughly GPT-5.6 Luna / Claude 4.9 according to benchmarks MiMo-V2.6-Pro-1.02T-A42B roughly GPT-5.6 Sol / Opus 5 according to benchmarks Perhaps with IQ2 flash will run on 128G M5?”
Kimiの推論と比べると、レスポンス速度が文字通り桁違いに速いです。
“you're definitely a metric fuckload (scientific term) faster with responses than on Kimi's inferencing”
huggingface.co/XiaomiMiMo/M... MiMo-V2.6がリリースされました!そして個人的にそれ以上に重要なのが技術レポートです。最新のフロンティアモデルの技術レポートとしては、これまでで最も充実した内容になっています。本当に素晴らしいです。
“huggingface.co/XiaomiMiMo/M... MiMo-V2.6 is out! and, more importantly to me, the tech report. this is the most batteries-included tech report for a modern frontier model ever. really cool stuff.”
MiMo V2.5自体普通にDeepSeekV4Flash 0731より強い場面は明確にあったし、ループ問題細なければ・・・ って感じだったけど、これ覚醒してそうだな。
試してみましたが第一印象は良くありませんでした。AIに画像生成を頼んだら、画像の起源や寸法の計算方法などを解説した本一冊分のような長文を書き始めました。うんざりです。20分経っても画像はまだ出力されず、延々とテキスト(それも英語で)を書き続けています。
“Testei e a primeira impressão não foi boa. Pedi para a IA gerar uma imagem e ela está escrevendo um livro explicando sobre a origem da imagem, como foi calculado as dimensões, etc. Um saco. Já faz 20 minutos e a imagem ainda não foi disponibilizada (continua redigindo texto e em inglês).”
案件レビューですか?Opencodeで試しましたが、クソ遅い上にDSv4.1 Maxよりも結果が悪いです。DSv4.1 Maxの方が5〜6倍はずっと速い。Mimo 2.6proの方が安いかもしれませんが、実用的な生産性では依然としてDS4.1が最強です。
“Paid review? I tried it on Opencode, its slow as f, and the result is worse than DSv4.1 Max, and its faster, much much faster like 5-6 times faster. So even Mimo 2.6pro is cheaper but DS4.1 is still king of productive.”
私が試したproもひどい出来だったので、flashは試すこともせず即座に返金しました。
“我测试的pro也很差,flash干脆没试直接退款了”
Xiaomiのmimo-v2.6 proの初日、まるで爆弾解体でもするかのようにオリエンテーションのチェックリストを進めました。プレスリリースには「kimi k3を凌駕する」と書いてありましたが、一体何の面で?1分あたりのツール呼び出し回数ですか?
“day one on xiaomi's mimo-v2.6 pro and i ran the orientation checklist like i was defusing a bomb. the press release said "surpasses kimi k3." at what. tool calls per minute”
MiMo-V2.6 Proがde indexで46点を獲得し、DeepSeek-V4.1(https://artificialanalysis.ai/models/deepseek-v4-1-flash)が39点というのは怪しい気がします。https://mimo.xiaomi.com/mimo-v2-6 の下部にある付録によれば、deepseekのモデルがmimoを上回ることもあり、能力にそこまで大差はありません。1週間前にも、明らかに賢いモデルであるfable 5よりopus 5の方が1点高く表示されていましたし(これはすでに修正済みですが)。
“It feels suspicious that MiMo-V2.6 Pro gets 46 in de index while DeepSeek-V4.1 (https://artificialanalysis.ai/models/deepseek-v4-1-flash) gets 39. According to the appendix at the bottom of https://mimo.xiaomi.com/mimo-v2-6 the deepseek model sometimes surpasses mimo and it's not so far behind in capabilities. A week ago opus 5 appeared 1 points ahead of fable 5 despite fable being a much smarter model (this has been corrected already)”
グラフのほとんどがゼロから始まっていないのを見る限り、347万ドルというのは事後学習(post-training)の費用しか含まれていないような印象を受けます。トレーニングもろくにされていないモデルがDeepSWE v1.1で48点を取れるものでしょうか?https://mimo.xiaomi.com/rl/
“I sorta got the impression that the $3.47 million only covered post-training , given that few of the graphs start at zero. Is a barely-trained model going to score 48 on DeepSWE v1.1 ? https://mimo.xiaomi.com/rl/”
やっぱりダメですね。ベンチマークスコアだけは一丁前で、実際の実装は使い物になりません。
“還是不行,跑分第一,實作一坨”
これ役に立つの?学習データはどこから盗んできたのか公開できるんですかね?笑わせないでほしいです。
“有用吗?训练的数据哪里偷来的感公布吗?笑死个人”
安価なエネルギーで作ったAnthropicの劣化コピーに過ぎない..
“Nothing but a cheap energy Anthropic mirror..”
今回使用されたMiMo V2.6-Pro側に問題があったのであって、モデル自体の能力の問題ではないのではないかと疑っています。
“我怀疑本次所使用的 MiMo V2.6-Pro 是有问题的,而不是模型能力”