basics
この数年、AI業界を支配してきた信念は単純でした。「モデル、データ、計算量を大きくすれば、性能は予測どおりに良くなる」というものです。
スケーリング則とは、この考え方を支える経験則だ。モデルのサイズ、訓練データ量、投入する計算資源を増やすと、ある程度まではかなり予測可能な形で性能が向上するという観測結果であり、これが投資家に、ますます大規模な訓練に莫大な資金を投じる根拠を与えた。
ムーアの法則はコンピュータチップのトランジスタ密度が時とともにおおよそ倍増していくという歴史的な傾向を表し、マーフィーの法則は『失敗しうることは必ず失敗する』という皮肉な格言だ。どちらもAI最大の投資を正当化してきたデータ・計算量と性能の関係を表すものではない。
最近では『推論時スケーリング』——モデルを訓練時に大きくするのではなく、答える瞬間により長く考えさせることでも性能が確実に向上するという発見——に注目が移っている。これが従来の事前学習によるスケーリングが収穫逓減に陥りつつあるのかどうかをめぐる議論を呼んでいる。
basics
この目標の略称は?数学・コーディング・知識の問題集でモデルを採点し比較するこれは?この総称は?この単位の名前は?「700億パラメータのモデル」のように言うとき、この「パラメータ」は何を数えているのでしょうか?この現象を何と呼ぶでしょうか?この論文のタイトルは?この人のフィードバックを反映する追加訓練を何と呼ぶでしょうか?この上限を何と呼ぶでしょうか?その代表格Llamaは、どの企業が公開したものでしょうか?こうした複数の形式の入出力を扱うモデルを何と呼ぶでしょうか?この「推論モデル」がその時間に行っていることは?Quration — Quration AIQ