basics
Les entreprises d'IA adorent vanter la taille de leurs modèles avec un seul chiffre gigantesque, comme si un nombre plus grand garantissait à lui seul une machine plus intelligente.
Les paramètres désignent le nombre de valeurs ajustables, ou poids, réglées à l'intérieur d'un modèle pendant l'entraînement, et non le nombre de documents dont il a appris ou le nombre de personnes qu'il peut servir à la fois. En règle générale, plus de paramètres signifie une plus grande capacité pour un modèle à représenter des schémas complexes, puisqu'il y a simplement plus de valeurs internes ajustables pour capturer des nuances dans les données.
Le nombre de documents d'entraînement décrit la taille du jeu de données dont un modèle a appris, et le nombre d'utilisateurs simultanés relève de l'infrastructure serveur et de la demande, deux concepts très différents du décompte des poids ajustables intégrés au modèle lui-même.
Plus grand n'est pas automatiquement synonyme de meilleur, puisque des modèles plus petits mais bien entraînés ont de plus en plus égalé, voire dépassé, des modèles plus grands sur de nombreuses tâches, montrant que la façon dont un modèle est entraîné et les données qu'il voit peuvent compter tout autant que le nombre brut de paramètres.
basics
Comment appelle-t-on ce phénomène ?Comment s'appelait-il ?Comment appelle-t-on cette étape d'entraînement par retour humain ?Comment appelle-t-on cette limite ?Llama, le fer de lance des modèles « à poids ouverts » que n'importe qui peut télécharger et faire tourner sur ses propres serveurs, a été lancé par quelle entreprise ?Comment appelle-t-on les modèles capables de gérer plusieurs formes d'entrée et de sortie ?Que font ces « modèles de raisonnement » pendant cette pause ?Comment appelle-t-on cette approche ?Laquelle ?Quelle est l'une des principales réponses de l'industrie ?Pendant des années, une croyance simple a gouverné l'industrie de l'IA : « Augmentez le modèle, les données et le calcul, et la performance s'améliore de façon prévisible. » Comment appelle-t-on cette règle empirique — la justification des paris à plusieurs milliards ?Quel est l'acronyme de l'objectif au-delà de l'IA spécifique à une tâche — une intelligence artificielle aussi générale que celle d'un humain ?Quration — Quration AIQ