AI設計面接の新基準
- •AIシステム設計面接では、ChatGPT型製品、コードレビュワー、法務アシスタントの設計が問われている
- •AI Engineer求人は2025年に前年比143%増え、面接形式を変えている
- •候補者には、要件、アーキテクチャ、トレードオフ、障害、進化を含む7段階フレームワークが推奨される
KD Nuggetsが2026-08-19に伝えたところによると、AI Engineer、Applied Scientist、GenAI Engineerを採用する企業は、「ChatGPTを設計せよ」「顧客サポートAIを設計せよ」「GitHub Copilotを設計せよ」「AIコードレビュワーを設計せよ」「法務文書アシスタントを設計せよ」といったAIシステム設計の課題を使っている。面接で問われるのは、LLM APIを単に呼び出すことではなく、その周囲のアーキテクチャを説明し、圧力下で選択を defend できるかだ。
AI Engineerは米国で2年連続「最も急成長した職種」第1位となり、2025年の求人は前年比143%増だった。記事が引用したLinkedInデータによると、同職種の米国求人は2023年から2025年に75,000件増え、AIおよび機械学習職は同じ期間にテック求人市場の10%から50%へ拡大した。IGotAnOfferは、面接の中心が大規模言語モデルをエージェント型ループ、検索、コスト推論を通じて製品に組み込む設計へ移ったと報告している。2025年後半から2026年前半のフィールドガイドでは、よく出る課題としてAIチャットボット、文書QAまたは検索拡張生成、AIコーディングエージェント、音声アシスタントが挙がった。
面接官は、候補者が決定論的なCRUDサービスではなく、確率的でコスト制約のあるシステムを推論できるかを評価する。主要なトレードオフはレイテンシー、コスト、品質、安全性であり、シニア職向けの報告では、面接官が3から5の領域を選び、障害モードや過去の本番環境での問題を深掘りすることが多い。強い回答は、各レイヤーがなぜ存在するのか、それがなければ何が壊れるのかを説明する。
推奨プロセスは7段階で構成される。データソース、プライバシー規則、レイテンシー予算、事実誤りの許容度、想定規模、鮮度要件、ホスティング制約を明確にする。次に、1秒あたりのトークン数、コンテキストウィンドウサイズ、埋め込み量、1回の呼び出しコスト、ピークQPSを見積もる。さらに、入力、安全性、PII、オーケストレーター、検索、モデル、LLM後のガードレール、ストリーミング、可観測性の各レイヤーを描く。RAG戦略、プロンプト設計、キャッシュ、モデル階層化を深掘りし、トレードオフを明示する。幻覚、プロンプトインジェクション、プロバイダー障害、埋め込みドリフト、マルチテナント分離への対策を計画し、A/Bプロンプトテスト、フィードバックループ、評価ゲート、段階的なモデル移行を説明する。記事は、要件を明確にする前に解決策へ飛びつくことを、最も多く報告された失敗としている。
多くの課題で再利用される基本部品は5つある。RAGはクエリエンコーダー、検索器、生成器を組み合わせ、本番システムではチャンク化、埋め込みパイプライン、ベクトル検索、キャッシュ、評価ログ、アクセス制御を加える。記事によると、RAGだけで幻覚はおよそ40から71%減ることが多い。モデルルーティングは通常の要求を安価なモデルに送り、難しい要求に frontier models を使う。GPT-4級モデルは入力100万トークンあたり約$10、出力100万トークンあたり約$30で、応答に3から5秒かかる。1日10,000件の会話を処理し、各会話が5,000トークンの場合、1つのプロバイダーで月額$7,500を超える。エージェント要求の60から80%は通常処理で済むため、ルーティングは通常40から70%を節約する。ルーティング、セマンティックキャッシュ、プロンプト圧縮、ストリーミングを組み合わせると、品質を維持しながらコストを40から60%削減する。
ガードレールはモデルの前後で動く。LLM前のレイヤーは入力を検証し、PIIを秘匿し、プロンプトインジェクションを防ぐ。LLM後のレイヤーはスキーマ、拒否ポリシー、検索済み文脈に基づくファクトチェックを強制する。多層ガードレールは、3から20%のベースライン率に対し、幻覚リスクを71から89%減らせる。ただし記事は、出典によって差があるため、候補者はこれらの数値を範囲として示すべきだとしている。評価と可観測性では、モデルバージョン、検索メタデータ、ツールトレース、安全性判断、レイテンシー、リクエストごとのコストを記録し、生テキストではなくプロンプトハッシュを使う。
参照アーキテクチャは、短く使えば回答を強める。GitHub CopilotはIDE拡張機能でカーソル前後のコード、開いているファイル、import、言語メタデータを集める。Fill-in-the-Middleは隣接タブとファイルパスヘッダーを集め、プロンプトをGitHubのバックエンドへ送り、フィルタリングとAzureモデルルーティングを行う。記事によると、FIMはプレフィックスだけのプロンプトより受け入れ率を相対的に約10%押し上げる。他の例として、60+のユースケースでPIIリダクターを使うUberのGenAI Gateway、chain-of-thought reasoningとガードレールを備えたAirbnbの会話型AI、Vespa.ai上で1日200M件のクエリを処理するPerplexity、エスクローVPC内のモデルを使うSlackのステートレスRAG、Anthropicのマルチエージェント構成が挙げられている。