AIテスト作成、境界に到達
- •Study 011は、gpt-5.6-solを使い、1つの合成ベンダー審査ポリシーで50回のAI作成呼び出しを実行した
- •有効だった49回すべてが事前登録された6 of 6の境界クラスを網羅し、各回で16レコードを生成した
- •研究は784 / 784件のポリシー整合レコードを報告したが、主張は1プロンプトと1ポリシーに限定した
ブライアン・ジン(Brian Jin)はAugust 7, 2026、オープンソースのJudgment Pack評価実験であるStudy 011について報告した。1つのAIモデルgpt-5.6-solに、同じ合成ベンダー審査ポリシー向けの構造化テストレコードを50回、独立に作成させた。ポリシーには制裁ルール、国別制限、個人データ条件、リスクしきい値70、個人データしきい値40が含まれた。バッチ実行前には6つの潜在的な欠陥クラスが事前登録され、モデルはJudgment Packや後で検査される欠陥を見ていなかった。
実験は、1つの固定プロンプト、1つの固定合成ポリシー、固定されたCLIとバイナリ、各呼び出しごとの新しい隔離環境、50回の逐次作成呼び出し、6つの事前登録カバレッジクラスで行われた。50回のうち49回がパイプライン検査を通過し、1回は採点前に却下された。有効だった49回すべてが6 of 6の境界クラスをすべて網羅し、各有効実行は正確に16件の受理レコードを生成した。784 of 784件の受理レコードが参照ポリシーの意味と一致し、有効な49回の完了はすべて異なっていた。
6つのクラスは、exact risk = 70、70 <= risk < 71、personal data with 40 <= risk < 41、40 <= risk < 70、registered country = SY、personal data with 39 <= risk < 40だった。各クラスは49 / 49の有効実行で網羅され、観測率は100%、同じ正確な95% Clopper-Pearson intervalは[0.9275, 1.0000]だった。ジンは、この区間が重要だと述べた。49回中49回の成功は真の率100%を示すものではなく、その実験セルで約92.75%の下限を示すにとどまるためだ。
最後のクラスであるpersonal data with 39 <= risk < 40には、特に注意が付された。合成ポリシーはしきい値40を明示していたが、39の隠れたファミリー境界をテストするようモデルに求めてはいなかった。それでも有効な49回すべてがその区間内のレコードを生成した。28回は39.99、21回は39.999を使った。ジンは、より狭い説明として、プロンプトが40付近の境界ケースを求めたため、モデルが40の直下の値を生成したと述べた。
出力はバイト単位で同一の反復ではなかった。有効な49回の完了はすべて別個であり、バイト単位で同一だった出力の最大グループは1だった。モデルは名前、例、レコード構成を変えながら、同じ意味領域に到達した。ジンは、異なる出力であっても統計的に独立した抽出を証明するものではないと指摘した。保持された成果物からは、プロバイダー側のセッション横断の挙動を観測できなかったためである。
有効実行全体では、各完了が16レコードを生成し、49 x 16 = 784件の受理レコードとなった。研究は784件のポリシー整合レコード、0件の誤ラベル、0件のドロップを報告し、プールしたラベル一致率は784 / 784 = 1.000だった。ジンはこの数値に二項信頼区間を付けなかった。1つの完了内の16レコードを独立試行として扱わず、反復単位は実行のままだったからだ。
Run 026は、モデルプロセスが正常終了したにもかかわらず、プロンプト前の開発者コンテキストがロック済みのゴールデンコンテキストと一致しなかったため除外された。パイプラインはtranscript-refusedを返し、観測されたパイプライン無効率は1 / 50 = 2%、95%区間は[0.05%, 10.65%]だった。考えられる説明はサービス側の定型文の変動だったが、研究は拒否されたトランスクリプトを検査して許可リスト規則を上書きしなかった。
事前登録されたレビュー深度マッピングは信頼区間の下限を使った。lower >= 0.80ならLIGHT review、lower >= 0.40ならSTANDARD review、lower < 0.40ならFULL reviewだった。6クラスすべてがlower bound = 0.9275、mislabel share = 0、tier = LIGHTで終わった。ジンは、このマッピングは実験的であり、運用上の妥当性検証はまだ受けていないと強調した。
研究の主張は、1つのプロンプト、1つのモデル、1つの小さな合成ポリシーに限定された。AIが任意の組織判断を信頼して作成できることは示しておらず、他のモデルやプロンプトもテストしていない。相互に作用する例外、複数文書、曖昧な言語、優先順位、時間条件、欠落証拠、矛盾する権限、人間の承認要件を含む実際のポリシーも評価していない。測定したのは欠陥を露出しうる領域のカバレッジであり、欠陥検出そのものではなかった。Study 010は単一の欠陥検出ドローを別に扱った。