tech
2024年初め、OpenAIは書いた一文を短く写実的に見える動画クリップに変えるSoraを公開した。
Soraのようなテキストから動画を生成するAIは、書かれた説明文から直接短い動画クリップを生成する。プロンプトが描写する内容に合うように、コマからコマへ映像がどう変化し動くべきかを予測しているのだ。これにより、誰かが簡単な一文を入力するだけで、カメラを一切使わずに動く、しばしば驚くほどリアルな映像を得ることができる。とはいえこのシステムは、照明や物理法則のようにテキストに明示されていない無数の視覚的な細部を、実質的に想像で補わなければならない。
印刷されたフォトアルバムは印刷と組み立てを必要とする物理的な製品であり、テキストからデジタルの動く映像を生成することとは無関係だ。より速い自宅のインターネット接続は、AIモデルが映像コンテンツを生成することとは何の関係もないインターネットサービスのアップグレードにすぎない。
初期のテキストから動画への生成では、指の本数が違う手や、物体同士がすり抜けてしまうといった奇妙な不具合がよく見られ、物理的なリアリズムがこうしたモデルにとって今なお最も難しい課題の一つであることを示している。
tech
こうした「生成型」検索回答の根本的な狙いは?複数のAIエージェントを「オーケストレーションする」とは?2023年以降、フォードやGM、リビアンなどのライバルは何をすることに合意したか?粉砕後に残る、黒く金属を多く含む粉末は何と呼ばれるか?『ビークル・トゥ・グリッド(V2G)』技術は、その車に何をさせられるでしょうか?こうした旅客向けの空飛ぶタクシーは、一般にどの略語で呼ばれるでしょうか?ヤーラ・ビルケランドが注目される理由は何でしょう?水素燃料電池トラックは長距離輸送でどんな利点をうたっているのでしょう?NIOの「バッテリー交換」ステーションでは、わずか数分で何が起こるのでしょう?800ボルトアーキテクチャの主な利点は何でしょうか?このチップの名前は?こうした量子ビットは何と呼ばれる?Quration — Quration Play