tech
有些最大型的 AI 模型擁有數千億個參數,但回答單一提示時只會啟用其中一小部分。
混合專家模型(Mixture of Experts)把網路劃分成許多較小的專門子網路,稱為「專家」,並使用一套路由機制來決定每筆輸入應該由哪幾個專家來處理。它不會為每一次請求啟動整個模型裡的所有參數,而是只針對每個提示啟動一小部分相關的專家,讓整個模型得以擁有龐大的總參數量,同時把回答任何單一問題的成本,壓低到遠低於每次都動用全部參數的程度。
永久刪除未使用的參數,會讓模型日後無法再針對不同輸入調用這些參數,反而違背了保留眾多專門專家備用的初衷。讓每個參數運算兩次只會使成本加倍,而不是降低成本,恰與這項設計想達成的目標相反。
正是這種架構,讓今日最強大的模型能夠擁有高達數千億的參數量,卻依然能以一種若讓每個參數都參與每次回答就難以負擔的速度與成本,回應日常查詢。
tech
這種由AI生成的訓練素材叫什麼?第二種做法——用範例來訓練——叫什麼?這種文字「浮水印」通常是怎麼運作的?這種訓練技術叫什麼?這種壓縮技術叫什麼?能同時處理多種輸入類型的 AI 模型叫什麼?營運這項全無人商用機器人計程車服務的是哪家公司?在廣為使用的SAE分級中,代表完全自動化的最高等級數字是多少?汽車製造商特斯拉公布的人形機器人叫什麼名字?在非洲開創這項醫療無人機配送服務的是哪家公司?亞馬遜的倉儲機器人源自其2012年收購哪家機器人公司?由Intuitive Surgical製造、廣為使用的手術機器人叫什麼名字?Quration — Quration Play