テック各社、オープンモデルでAI費用削減
- •Uberは3月以降も利用増が続く中、AIリクエスト費用を34%、セッション費用を52%削減した
- •Pinterestはトランザクションで、オープンモデル費用が同等のクローズド専有モデルの8%未満だったと述べた
- •AT&Tはモデル変更後、出力品質が2%低下する一方でAI請求額を56%削減した
ゲルゲイ・オロス(Gergely Orosz)は9月10日、複数の大手テクノロジー企業がAI運用費を削減していると報告した。各社は一部ワークロードをフロンティアモデルからオープンモデルへ移し、モデルルーティング、週次ベンチマーク、支出管理、コンテキスト最適化を組み合わせている。The Pragmatic Engineerの記事によると、関係者は2026年初めにAI予算が膨らんだ後、推論プロバイダー上でより安価なオープンモデルを試し、単純な依頼を低コストのモデルへ振り分け、節約策を共有し、開発者ごとの月間AI利用上限を設定していると説明した。
Uberは、2026年の年間AI予算を最初の3カ月で使い切ったとされる後、AIリクエストあたりの費用を34%、AIセッションあたりの費用を52%削減した。AIトークンとセッションの利用は増え続けたが、総費用は3月以降横ばいだった。同社はより安い推論サービス上のオープンウェイトモデルを使い、フロンティアモデルとオープンモデルをベンチマークし、実作業に基づく週次ベンチマークを実施した。さらに、安価なサブエージェントモデルを使い、高度なモデルの既定値をMedium effortに設定し、1Mコンテキストウィンドウを持つモデルでも400Kトークン超で自動圧縮を起動し、Minionsハーネスでプロンプトをキャッシュした。
Uberの記事は、一部作業でオープンモデルの費用がフロンティアモデルより2-20x低いと述べた。最も高価なオープンウェイトモデルはコードレビュー1件あたり$0.30で、最も安いフロンティアモデルの$0.50、最も高いフロンティアモデルの$2.50と比べて低かった。オロスは、Uberがエージェント生成コードに目立つ変化を出さず、トークン費用を下げるための数十件の最適化を詳述したと書いた。
PinterestのCEO、ウィリアム・レディ(William Ready)は先月の決算説明会で、Pinterestが安全なクラウド基盤内で事後学習した小型の目的別モデルとオープンソースモデルを使っていると述べた。レディは、Pinterest AssistantがPinterestの用途ではクローズドな第三者モデルより優れた性能を示したと話した。Pinterestが自社データでオープンモデルを事後学習できるためだという。オープンモデルにより、トランザクションあたり費用は同等のクローズド専有モデルの8%未満になり、クローズドモデルで$100かかる処理は自社またはレンタルの推論基盤で約$8になった。
The Informationによると、AT&Tは一部ワークロードをオープンモデルへ移した後、AI出力品質の2%低下を測定しつつ、AI請求額を56%削減した。記事は、AT&Tに100,000人の従業員がおり、コード生成のような複雑な作業にはなお最先端モデルを使う一方、過去に提出されたコードの要約など軽いタスクはより安価なオープンソースモデルが担うとしている。AT&Tはモデル選択のルータープロバイダーであるLiteLLMを使い、一部の高度なAIタスク費用は最大56%下がった。
オロスは、AnthropicのClaudeとClaude Codeがわずか数カ月前にはエンジニアに好まれていたが、Anthropicモデルは高価になりつつあり、オープンウェイトモデルとOpenAIモデルは安くなっていると書いた。記事によると、典型的なAIエージェント実行では、Opus 5はGPT-5.6 Luna xhighやDeepSeekなどのモデルより100x高い。
DatabricksはStripe、Coinbase、Uber、RampのエンジニアにAI費用削減策を聞いた。オロスはDatabricksの要約から、最大の節約を生んだのはオープンモデルで、次に効果が大きかったのは賢いモデルルーティングだったと結論づけた。支出管理とコンテキスト最適化も費用を下げたが、結果はより小さかった。公開から1週間後、Rampのアラ・クラージアン(Ara Krahzian)は、Rampのデータに基づき、8月に上位1%の企業のAI支出が10%減ったと述べた。