AI用語
思考連鎖モニタリング
Chain-of-thought monitoring
思考連鎖モニタリングとは
モデルが答えに至る途中の推論過程を監視し、危険な意図や逸脱した振る舞いを検出する手法
別名: Chain-of-thought monitorability · 思考連鎖の監視可能性
他の言語での表記と説明
- 한국어사고 과정 모니터링
- 모델이 답을 내기까지의 중간 추론 흐름을 관찰해 위험하거나 비정상적인 행동을 탐지하는 기법이다.
- EnglishChain-of-thought monitoring
- Oversight method that inspects intermediate reasoning traces to detect unsafe or policy-violating behavior
関連用語
- 実行時監視システムの稼働中に動作や利用状況を継続的に確認することです。
- 自動推論チェック形式的手法を使い、システムの性質やポリシー違反を数学的に検査する技術
- LLMオブザーバビリティ大規模言語モデルの入力、出力、遅延、コスト、エラーなどを追跡し、挙動を分析できるようにする仕組み
- メイカー・チェッカー生成を行うノード(メイカー)と、その出力を評価・検証するノード(チェッカー)を分離して配置する二重検証アーキテクチャ。
- ゲートカナリア既知の悪い入力で安全チェックが正常に発火するかを継続確認する監視手法
- 多段階検証推論の各ステップや全体の論理構造を個別に評価し、思考プロセスにおける誤りや矛盾を修正する手法。
- テイント解析プログラム実行時に、外部からの入力などの未検証データがシステムのセキュリティに関わる部分へ影響を与えないか追跡する解析手法。
- 実行時批評器システムの動作中に出力や行動を評価し、修正判断の材料を与える評価機構
- プロンプト改善AIへの指示文に条件、制約、確認手順などを補い、期待する出力を明確にする手法
- Lean certificateLean証明支援系で機械的に検証できる形式証明の記録
- リンティングソースコードを静的に解析し、プログラムの誤りや規約違反、潜在的なバグを自動的に検出するプロセスのこと
- 自動推論数学的論理を用いて、特定の声明やプログラムの動作が正しいかどうかを厳密に検証する技術。