AI使い比べAIを探すAIニュースAI活用法
会社紹介
個人情報保護方針利用規約FAQお問い合せお問い合わせ
エーアイビー株式会社事業者情報
© 2026 AIB Inc.

HYMELL、LLM推論コストを推定

HYMELL、LLM推論コストを推定

Semantic Scholar·2026年8月11日 (火)
  • •HYMELLは、3階層の分析モデルと機械学習を組み合わせ、LLM推論のレイテンシとエネルギーを推定する
  • •フレームワークは、密なFFN、Mixture-of-experts FFN、Multi-head attention、Grouped-query attentionに対応する
  • •NVIDIA H100での評価では、LLaMA 3 8Bのprefillとdecodeで誤差5%未満を示した
  • •HYMELLは、3階層の分析モデルと機械学習を組み合わせ、LLM推論のレイテンシとエネルギーを推定する
  • •フレームワークは、密なFFN、Mixture-of-experts FFN、Multi-head attention、Grouped-query attentionに対応する
  • •NVIDIA H100での評価では、LLaMA 3 8Bのprefillとdecodeで誤差5%未満を示した
  • •HYMELLは、3階層の分析モデルと機械学習を組み合わせ、LLM推論のレイテンシとエネルギーを推定する
  • •フレームワークは、密なFFN、Mixture-of-experts FFN、Multi-head attention、Grouped-query attentionに対応する
  • •NVIDIA H100での評価では、LLaMA 3 8Bのprefillとdecodeで誤差5%未満を示した
  • •HYMELLは、3階層の分析モデルと機械学習を組み合わせ、LLM推論のレイテンシとエネルギーを推定する
  • •フレームワークは、密なFFN、Mixture-of-experts FFN、Multi-head attention、Grouped-query attentionに対応する
  • •NVIDIA H100での評価では、LLaMA 3 8Bのprefillとdecodeで誤差5%未満を示した

サイード・ショコウファ(Saeid Shokoufa)、モハマド・エルファン・サデギ(Mohammad Erfan Sadeghi)、M. カマル(M. Kamal)らは、LLM推論のレイテンシとエネルギーを推定するハイブリッド型3階層フレームワーク「HYMELL」を、2026-08-07付のarXiv論文で発表した。LLMの規模拡大に伴って増える計算コスト、エネルギー消費、推論レイテンシを対象に、持続可能な人工知能の展開と、ハードウェアを意識した設計を支援する狙いだ。

HYMELLは分析モデリングと機械学習を組み合わせ、LLMの実行を3階層に分ける。基本演算は分析的に推定し、より高いレベルの部品はMLで予測し、prefillとdecodeの各段階にまたがるシステムレベルのオーバーヘッドはend-to-endモデルで扱う。フレームワークは、密なfeed-forward network、Mixture-of-experts feed-forward network、Multi-head attention、Grouped-query attentionに対応する。NVIDIA H100 GPUでのテストでは、HYMELLはLLaMA 3 8Bのprefillとdecodeの両段階で誤差5%未満を達成し、アーキテクチャ上のパラメータから、ハードウェアなしで設計空間を探索できることを示した。

サイード・ショコウファ(Saeid Shokoufa)、モハマド・エルファン・サデギ(Mohammad Erfan Sadeghi)、M. カマル(M. Kamal)らは、LLM推論のレイテンシとエネルギーを推定するハイブリッド型3階層フレームワーク「HYMELL」を、2026-08-07付のarXiv論文で発表した。LLMの規模拡大に伴って増える計算コスト、エネルギー消費、推論レイテンシを対象に、持続可能な人工知能の展開と、ハードウェアを意識した設計を支援する狙いだ。

HYMELLは分析モデリングと機械学習を組み合わせ、LLMの実行を3階層に分ける。基本演算は分析的に推定し、より高いレベルの部品はMLで予測し、prefillとdecodeの各段階にまたがるシステムレベルのオーバーヘッドはend-to-endモデルで扱う。フレームワークは、密なfeed-forward network、Mixture-of-experts feed-forward network、Multi-head attention、Grouped-query attentionに対応する。NVIDIA H100 GPUでのテストでは、HYMELLはLLaMA 3 8Bのprefillとdecodeの両段階で誤差5%未満を達成し、アーキテクチャ上のパラメータから、ハードウェアなしで設計空間を探索できることを示した。

原文(英語)を読む·2026年8月7日
インフラ#hymell#llm#inference#latency#energy#nvidia h100#llama 3#mixture of experts#grouped query attention