basics
AI 公司很愛用一個巨大的數字來炫耀模型大小,好像數字越大機器就一定越聰明。
「參數」指的是模型在訓練過程中不斷調整的可調整數值,也就是「權重」的數量,而不是模型學習過的文件數量,也不是它能同時服務多少使用者。一般來說,參數愈多,代表模型能容納更複雜模式的能力愈強,因為內部可以調整的數值更多,更能捕捉資料中的細微差異。
訓練文件的數量描述的是模型學習所用資料集的大小,同時使用者的數量則牽涉到伺服器基礎設施和需求量的問題,這兩者都跟模型本身內建的可調整權重數量截然不同。
「愈大不代表愈好」,因為訓練得當的較小模型,在許多任務上已逐漸追平甚至超越較大的模型,顯示訓練方式和所用資料的品質,可能和單純的參數數量一樣重要。
basics
這種現象叫什麼?這篇論文叫什麼?這個利用人類回饋進行訓練的步驟叫什麼?這個上限叫什麼?「開放權重」模型的旗艦代表 Llama,是由哪家公司發布的?我們把這種能同時處理多種輸入與輸出形式的模型叫什麼?這些「推理模型」在停頓期間,到底在做什麼?這種做法叫什麼?它是什麼?業界主要的應對方式是什麼?這條為千億級投資背書的經驗法則叫什麼?這個超越特定任務型 AI、目標是打造像人類一樣通用機器智慧的詞,其縮寫是什麼?Quration — Quration AIQ