basics
Kwa miaka mingi, imani rahisi moja iliongoza sekta ya AI: 'Ongeza modeli, data, na uwezo wa kuchakata, matokeo yataongezeka kwa njia inayotabirika.'
Sheria za upanuzi (scaling laws) ni mtindo wa kimajaribio ulio nyuma ya imani hii — mahusiano yaliyoonekana yanayoonyesha kwamba, hadi kiwango fulani, kuongeza ukubwa wa modeli, data yake ya mafunzo, na uwezo wa kukokotoa unaotumika hutoa maboresho yanayoweza kutabirika kwa kiasi cha utendaji, jambo lililowapa wawekezaji sababu ya kuwekeza kiasi kikubwa cha fedha katika mafunzo makubwa zaidi na zaidi.
Sheria ya Moore inaelezea mwelekeo wa kihistoria wa chip za kompyuta kuongeza mara mbili msongamano wa transistor kwa muda, na Sheria ya Murphy ni msemo wa kejeli kwamba chochote kinachoweza kwenda vibaya kitakwenda vibaya — hakuna inayoelezea uhusiano wa data-na-ukokotoaji kwa utendaji uliohalalisha uwekezaji mkubwa zaidi wa AI.
Hivi karibuni zaidi, umakini umehamia kwenye 'inference-time scaling' — ugunduzi kwamba kuruhusu modeli ifikirie kwa muda mrefu zaidi wakati wa kujibu, badala ya kufanya tu modeli kubwa zaidi wakati wa mafunzo, kunaweza pia kuongeza utendaji kwa kutegemewa — kukizua mjadala kama upanuzi wa jadi wa mafunzo ya awali unaingia katika mapato yanayopungua.
basics
Kifupisho cha lengo lililo mbali zaidi ya AI ya kazi maalum — akili ya mashine iliyo ya jumla kama ya binadamu — ni nini?Hizi zinaitwaje?Neno la jumla ni?Vipande hivi vinaitwaje?Watu wanapoeleza modeli ya AI ina 'parameta bilioni 70,' wanahesabu nini hasa?Jambo hili linaitwaje?Iliitwa nini?Hatua hii ya mafunzo yenye maoni ya binadamu inaitwaje?Mpaka huu unaitwaje?Llama, kinara wa miundo hii ya 'open-weight,' ilitolewa na kampuni gani?Miundo inayoshughulikia aina nyingi za taarifa za kuingiza na kutoa (input/output) huitwaje?Miundo hii ya 'reasoning' inafanya nini wakati wa kusita huko?Quration — Quration AIQ