27:51AI Explained
o1、ひいてはo3、R1、Claude extended thinkingが、次トークン予測に強化学習を重ねて正しい多段階の回答を評価する仕組みと、それがモデルへの指示方法に何を意味するかを、誇張なく最も明快に説明しています。この動画を見れば、記事の「『think step by step』と言うのをやめ、仕様を書く」という助言が恣意的なものではないと分かります。
このセクションから得られるもの: 推論モデル向けのプロンプトでは、目に見える思考の連鎖を求めるのではなく、問題、制約、成功基準を指定すべき理由を理解できます。
視聴または事前に知っておくべきもの: 基本的なプロンプティングの経験と、oシリーズ、Claude extended thinking、R1などのモデル名に関する知識。
AI Expertの注記: o1という用語は歴史的背景として捉えてください。実用的な教訓は、厳密なタスク仕様を重視するプロンプティングへの転換です。現在のモデル名、製品上の制限、ベストプラクティスは今後も変わります。
