Hugging Faceを活用したAIエージェントによる3Dギャラリー構築
- •開発者が2つのHugging Face SpacesをAIエージェントで連結し、パリの3Dギャラリーを構築した。
- •Gradio Spacesが公開したagents.mdファイルにより、カスタム統合なしでエージェントによるモデル呼び出しが可能になった。
- •画像生成から3Dガウシアンスプラッティング変換、Three.jsを用いたUI構築までを自動パイプラインとして実現した。
2026年6月9日、開発者のミシグ・ダヴァドルジ(Mishig Davaadorj)は、自律型コーディングエージェントが2つのHugging Face Spacesを連結し、パリの建造物の3Dギャラリーを構築する様子を実演した。エージェントはこれらのSpacesを直接呼び出すことで、手動の3D再構築ツールや画像生成インターフェースの操作を介さずに資産を生成した。完成したプロジェクトは静的Space「mishig/monuments-de-paris」として公開されており、ソフトウェアを巨大なモノリスとして構築するのではなく、文書化された小さな構成要素から組み立てる「ビルディングブロック経済」の概念を体現している。
このワークフローは、Gradio Spacesが提供するテキストファイル「agents.md」に依拠している。同ファイルは、スキーマURLや呼び出し用テンプレート、認証の手順をエージェントに提供する役割を持つ。ユーザーがHF_TOKENを設定することで、エージェントは特定のクライアントライブラリやハードコーディングされた統合なしでエンドポイントを操作できる。今回の事例では、「ideogram-ai/ideogram4」による記念碑の画像生成と、「VAST-AI/TripoSplat」によるそれらの画像からの3Dガウシアンスプラッティング再構築が連結された。
エージェントはコンポーネントの連携に加え、3D座標の反転、被写体の自動フレーミング、さらに.plyファイルを約3倍の圧縮率を持つ.ksplat形式に変換する処理も実行した。最終的に、ユーザー対話用のThree.jsビューアが構築された。人間の役割はカメラ位置の調整やオブジェクト選択といった美的判断に限定された。本事例は、オープンウェイトモデルと標準化されたドキュメントを活用することで、エージェントがモデルを呼び出し可能なプリミティブとして扱い、複雑なマルチメディアパイプラインを処理できることを示している。