tech
2024년 초 오픈AI는 문장 하나를 짧고 사실적으로 보이는 영상 클립으로 바꿔 주는 소라(Sora)를 공개했다.
소라 같은 텍스트-투-비디오 AI는 글로 쓴 설명만으로 짧은 영상 클립을 직접 생성하며, 프롬프트가 묘사하는 내용에 맞춰 한 프레임에서 다음 프레임으로 이미지가 어떻게 변하고 움직여야 하는지를 예측합니다. 이 덕분에 누군가는 간단한 한 문장만 입력해도 카메라를 전혀 쓰지 않고 놀라울 만큼 현실적인 움직이는 장면을 얻을 수 있지만, 시스템은 여전히 텍스트에 명시되지 않은 조명이나 물리 법칙 같은 수많은 시각적 세부사항을 사실상 스스로 상상해내야 합니다.
인화된 사진 앨범은 인쇄와 조립이 필요한 실물 제품으로, 텍스트로부터 디지털 동영상을 생성하는 것과는 무관합니다. 더 빠른 가정용 인터넷은 인터넷 서비스 업그레이드일 뿐, AI 모델이 영상 콘텐츠를 만드는 것과는 아무 관계가 없습니다.
초기의 텍스트-투-비디오 클립은 손가락 개수가 이상하거나 물체가 서로를 통과하는 것 같은 기이한 오류를 종종 보여주는데, 이는 물리적 현실감이 이런 모델들에게 여전히 가장 구현하기 어려운 부분 중 하나임을 잘 보여줍니다.
tech
이런 '생성형' 검색 답변의 핵심 발상은?여러 AI 에이전트를 '오케스트레이션'한다는 것은?2023년부터 포드, GM, 리비안 같은 경쟁사들은 무엇을 하기로 합의했을까?분쇄 후 남는 검고 금속이 풍부한 가루를 무엇이라 부를까?'차량-그리드(V2G)' 기술은 그 차가 무엇을 할 수 있게 해줄까요?이런 승객용 에어 택시는 흔히 어떤 약어로 불릴까요?야라 비르켈란이 주목받는 이유는 무엇일까요?수소 연료전지 트럭은 장거리 운송에서 어떤 장점을 내세울까요?NIO의 '배터리 교체' 스테이션에서는 단 몇 분 만에 무슨 일이 일어날까요?800볼트 아키텍처의 가장 큰 장점은 무엇일까요?이 칩의 이름은 무엇일까?이런 큐비트를 무엇이라 부를까?Quration — Quration Play