実践連載
-
完全一致だけでモデルを裁かない—グレード±1を併記する評価法
Category : 実践連載最近の運用記録をもとに、段階評価では境界付近のわずかな差が完全不一致に見え、モデル差を過大評価しやすいという課…
-
ClaudeとCodexの順位一致を測る—Spearman相関で影運転を評価する
Category : 実践連載最近の運用記録をもとに、二つのLLMが同じ対象を評価しても、点数の尺度が違えば単純な平均差だけでは比較しにくい…
-
JSONLログから実行セッションを監査する—評価・プローブ・再オープンを分ける
Category : 実践連載最近の運用記録をもとに、更新されたJSONLファイルをすべて新規評価として数えると、プローブや再オープンまで成…
-
1対象1セッションで大規模評価を分離する—障害範囲を小さくする設計
Category : 実践連載最近の運用記録をもとに、多数の対象を一つの長い会話で処理すると、一件の失敗が全体へ波及し再実行単位も大きくなる…
-
日次バッチの欠損を対象IDで突合する—件数だけに頼らない復旧確認
Category : 実践連載最近の運用記録をもとに、再実行後の総件数が増えても、欠けていた対象がすべて補完されたかは分からないという課題を…
