7:56Chroma
Kelly Hongが18のモデルを対象としたChromaの研究を解説します。needle-in-a-haystackテストのスコアが誤解を招く理由、曖昧さや妨害情報によって性能が低下する仕組み、単純な文字列反復タスクでさえ500トークンを超えると性能が落ちる理由を扱います。短く、根拠に基づいており、工学的な対策へ進む前に記事が読者へ真剣に受け止めてほしい問題を的確に示しています。
このセクションから得られるもの: 曖昧さや妨害情報によって長いコンテキストが機能しなくなる仕組みを理解し、そのリスクを踏まえたテストを設計できるようになります。
視聴または事前に知っておくべきもの: LLMの基本用語以外に前提知識はありません。短い研究解説です。
AI Expertの注記: モデル名、価格、機能は急速に変化します。意思決定のパターンを学ぶために活用し、導入前には現在のモデルの挙動を検証してください。
