tech
AI研究機関が学習に使える新しい人間の書いた文章が不足してきたため、多くが新モデルを他のAIが作ったデータで一部学習させるようになりました。
合成データとは、実世界の人間の文章や画像、出来事から直接収集されたものではなく、AIモデルやコンピューターシミュレーションによって生成された訓練用の素材のことだ。AIラボが訓練に使える質の高い新鮮な人間生成のテキストの量に、ますます限界を感じるようになる中で、合成データはそのすき間を埋める手段となる。特に実例が乏しかったり、集めるのに費用がかかったり、非公開だったりする分野で、研究者が大量の追加的な、目的に合わせた訓練用の例を生成できるようにする。
オープンソースデータとは、誰でも自由に利用・改変できる情報やコードのことを指すライセンス上の概念であり、そのコンテンツがAIによって生成されたかどうかとは無関係だ。メタデータは単に、ファイルの作成日や作成者といった、他のデータに関する記述的な情報にすぎず、AIシステム自体が生成する訓練用コンテンツとは異なる。
研究者たちは、本物の人間が作った素材ではなく、以前のAIモデルが生成したデータに新しいAIモデルをあまりに大きく依存させて訓練すると、世代を重ねるごとに質や多様性が徐々に劣化していく恐れがあると懸念を示している。この連鎖的なフィードバック問題は「モデル崩壊」と呼ばれている。
tech
例で学習させる二つ目の方法は何と呼ばれるでしょう?この文章の『電子透かし』は一般にどう機能するのでしょう?この訓練手法は何と呼ばれるでしょう?この圧縮技術は何と呼ばれるでしょう?複数の入力形式を同時に扱うAIモデルは何と呼ばれるでしょう?この完全無人の商用ロボタクシーサービスを運営する企業は?広く使われるSAEの尺度で、完全自動化を表す最も高いレベルの数字は?自動車メーカーのテスラが公開した人型ロボットの名前は?アフリカでこの医療用ドローン配送サービスを開拓した企業は?アマゾンの倉庫ロボットは、2012年にどのロボット企業を買収したことから始まった?インテュイティブ・サージカル製の広く使われる手術ロボットの名前は?このレーザー除草ロボットが農家にもたらす主な利点は?Quration — Quration Play