AI使い比べAIを探すAIニュースAI活用法
会社紹介
個人情報保護方針利用規約FAQお問い合せお問い合わせ
エーアイビー株式会社事業者情報
© 2026 AIB Inc.

JevがLangSmith Evalsに参加

JevがLangSmith Evalsに参加

LangChain·2026年9月22日 (火)
  • •Jevは、自由度の高いエージェント動作を評価する構造化ジャッジとしてLangSmith Evalsで利用可能になった
  • •TypeSafe AIによると、Jevは同等のLLMより最大約450分の1のコスト、約200倍の速度で動く
  • •LangChainのテストでJevは人間レビュアーと一致し、全判定の費用は$0.34だった
  • •Jevは、自由度の高いエージェント動作を評価する構造化ジャッジとしてLangSmith Evalsで利用可能になった
  • •TypeSafe AIによると、Jevは同等のLLMより最大約450分の1のコスト、約200倍の速度で動く
  • •LangChainのテストでJevは人間レビュアーと一致し、全判定の費用は$0.34だった
  • •Jevは、自由度の高いエージェント動作を評価する構造化ジャッジとしてLangSmith Evalsで利用可能になった
  • •TypeSafe AIによると、Jevは同等のLLMより最大約450分の1のコスト、約200倍の速度で動く
  • •LangChainのテストでJevは人間レビュアーと一致し、全判定の費用は$0.34だった
  • •Jevは、自由度の高いエージェント動作を評価する構造化ジャッジとしてLangSmith Evalsで利用可能になった
  • •TypeSafe AIによると、Jevは同等のLLMより最大約450分の1のコスト、約200倍の速度で動く
  • •LangChainのテストでJevは人間レビュアーと一致し、全判定の費用は$0.34だった

LangChainは2026年9月21日、LangSmithでの評価用ジャッジとしてJevを提供開始した。チームは、自由度の高いエージェント動作をより速く、低コストで評価し、LangSmith内に構造化されたフィードバックを記録できる。Jevは任意のLangSmithトレーシングプロジェクトのEvaluatorsタブから利用でき、オンライン評価(実行中のrunやthreadを判定する仕組み)向けにJev-as-a-judge evaluatorとして設定する。

LangChainは、Jevをエージェント評価における第3の手法と位置づける。従来のコードベース評価器は、エージェントがツールを呼んだか、出力パターンに一致したか、特定のフィールドを含んだかといった決定的条件を確認するが、非決定的なエージェントが同じ課題を複数の妥当な方法で解く場合、有効な動作を見落とすことがある。LLM-as-a-judge評価器は、LLMジャッジ、指示、ルーブリック、エージェントトレースを使って判定を出すが、LangChainは、速度が遅く、費用が高く、非決定的で、自由記述の推論を構造化出力に変換する際に誤りが起きやすいとしている。

TypeSafe AIが開発したJevは、従来型LLMではなくSystem One model(高速な構造化意思決定モデル)と説明される。テキストは生成せず、エージェントトレース、単一メッセージ、その他の文脈といった状態を評価し、型付きの回答と確率を返す。Jevは3種類の質問をサポートする。noulはyes/noの確率を返し、choiceは選択肢から1つを選び、scoreは順序付き尺度で状態を評価する。LangChainは例としてPII leakage(個人識別情報の漏えい)、ユーザー意図、ユーザーの不満を挙げた。

LangChainによると、Jevはエージェント評価の3つの課題であるコスト、速度、並列化に対応する。TypeSafe AIによれば、Jevは分類タスクで同等のLLMより最大約450分の1のコスト、約200倍の速度で動き、同じ状態について複数の質問を並列に評価できる。LangChainは、低コスト化により、チームがサンプリングではなくすべてのトレースを採点し、各トレースでより多くの基準を確認し、一貫性を測るために判定を繰り返せるとしている。より速いオンライン評価は、PII leakage、プロンプトインジェクション、毒性などの問題検出からアラートやWebhook起動までの時間を短縮できるという。

LangChainのテストでは、JevがGPT-5.6 Luna、GPT-5.6 Terra、Claude Sonnet 4.6と、精度、一貫性、速度、コストで比較された。Jevはすべての判断で人間レビュアーと一致し、LLMジャッジより分散が92-913倍低かった。1回あたりの平均時間はJevが0.44秒、LLMジャッジが2.16-2.83秒だった。全判定の費用は、Jevが1回あたり$0.00035で合計$0.34だったのに対し、GPT-5.6 Lunaは$0.39、GPT-5.6 Terraは$2.90、Claude Sonnet 4.6は$28.17だった。LangChainは、これは1つのエージェントに対する1つのテストだと注意を促している。

Jev-as-a-judgeを使うには、LangSmithユーザーがProvider secretsにTypeSafe API keyを追加し、トレーシングプロジェクトのEvaluatorsタブからLLM-as-a-Judge Evaluatorを作成し、providerにTypeSafeを選び、modelにjev-latestを選択する。評価器は、プロンプトと採点基準ではなく、stateと型付き質問を定義する。LangChainは、TypeSafeが現時点でzero data retentionを提供していないため、評価のために送信されたプロンプトと出力がproviderに保持される可能性があると記している。各質問はfeedback keyになり、ユーザーはそれをフィルター、チャート、アラート、または自動化に接続できる。

LangChainは2026年9月21日、LangSmithでの評価用ジャッジとしてJevを提供開始した。チームは、自由度の高いエージェント動作をより速く、低コストで評価し、LangSmith内に構造化されたフィードバックを記録できる。Jevは任意のLangSmithトレーシングプロジェクトのEvaluatorsタブから利用でき、オンライン評価(実行中のrunやthreadを判定する仕組み)向けにJev-as-a-judge evaluatorとして設定する。

LangChainは、Jevをエージェント評価における第3の手法と位置づける。従来のコードベース評価器は、エージェントがツールを呼んだか、出力パターンに一致したか、特定のフィールドを含んだかといった決定的条件を確認するが、非決定的なエージェントが同じ課題を複数の妥当な方法で解く場合、有効な動作を見落とすことがある。LLM-as-a-judge評価器は、LLMジャッジ、指示、ルーブリック、エージェントトレースを使って判定を出すが、LangChainは、速度が遅く、費用が高く、非決定的で、自由記述の推論を構造化出力に変換する際に誤りが起きやすいとしている。

TypeSafe AIが開発したJevは、従来型LLMではなくSystem One model(高速な構造化意思決定モデル)と説明される。テキストは生成せず、エージェントトレース、単一メッセージ、その他の文脈といった状態を評価し、型付きの回答と確率を返す。Jevは3種類の質問をサポートする。noulはyes/noの確率を返し、choiceは選択肢から1つを選び、scoreは順序付き尺度で状態を評価する。LangChainは例としてPII leakage(個人識別情報の漏えい)、ユーザー意図、ユーザーの不満を挙げた。

LangChainによると、Jevはエージェント評価の3つの課題であるコスト、速度、並列化に対応する。TypeSafe AIによれば、Jevは分類タスクで同等のLLMより最大約450分の1のコスト、約200倍の速度で動き、同じ状態について複数の質問を並列に評価できる。LangChainは、低コスト化により、チームがサンプリングではなくすべてのトレースを採点し、各トレースでより多くの基準を確認し、一貫性を測るために判定を繰り返せるとしている。より速いオンライン評価は、PII leakage、プロンプトインジェクション、毒性などの問題検出からアラートやWebhook起動までの時間を短縮できるという。

LangChainのテストでは、JevがGPT-5.6 Luna、GPT-5.6 Terra、Claude Sonnet 4.6と、精度、一貫性、速度、コストで比較された。Jevはすべての判断で人間レビュアーと一致し、LLMジャッジより分散が92-913倍低かった。1回あたりの平均時間はJevが0.44秒、LLMジャッジが2.16-2.83秒だった。全判定の費用は、Jevが1回あたり$0.00035で合計$0.34だったのに対し、GPT-5.6 Lunaは$0.39、GPT-5.6 Terraは$2.90、Claude Sonnet 4.6は$28.17だった。LangChainは、これは1つのエージェントに対する1つのテストだと注意を促している。

Jev-as-a-judgeを使うには、LangSmithユーザーがProvider secretsにTypeSafe API keyを追加し、トレーシングプロジェクトのEvaluatorsタブからLLM-as-a-Judge Evaluatorを作成し、providerにTypeSafeを選び、modelにjev-latestを選択する。評価器は、プロンプトと採点基準ではなく、stateと型付き質問を定義する。LangChainは、TypeSafeが現時点でzero data retentionを提供していないため、評価のために送信されたプロンプトと出力がproviderに保持される可能性があると記している。各質問はfeedback keyになり、ユーザーはそれをフィルター、チャート、アラート、または自動化に接続できる。

原文(英語)を読む·2026年9月21日
#jev#langsmith#typesafe ai#agent evals#llm as a judge#system one model#online evals#pii leakage#prompt injection