Quration Play

tech

Alguns dos maiores modelos de IA contêm centenas de bilhões de parâmetros, mas ativam apenas uma pequena fração deles para responder a um único comando.

Como um modelo de 'Mistura de Especialistas' consegue isso?

Direciona cada entrada para algumas sub-redes especializadas
Uma Mistura de Especialistas divide a rede em vários submodelos 'especialistas', e um roteador escolhe apenas alguns por token, então um modelo enorme roda por uma fração do custo. Esse projeto permite que os laboratórios ampliem a capacidade total sem um salto equivalente no processamento por resposta.

Um modelo de Mistura de Especialistas (Mixture of Experts) divide sua rede em muitas sub-redes menores e especializadas, chamadas "especialistas", e usa um mecanismo de roteamento para decidir qual pequeno grupo deve processar cada parte da entrada. Em vez de ativar cada parâmetro do modelo inteiro para cada solicitação, apenas um pequeno subconjunto relevante de especialistas é acionado para um determinado prompt, permitindo que o modelo como um todo mantenha uma contagem total de parâmetros enorme mantendo o custo de responder a qualquer pergunta muito menor do que usar todos os parâmetros o tempo todo.

Apagar parâmetros não utilizados permanentemente eliminaria a capacidade do modelo de recorrer a eles para entradas diferentes no futuro, anulando o propósito de ter muitos especialistas disponíveis. Rodar cada parâmetro duas vezes simplesmente dobraria o custo em vez de reduzi-lo, o oposto do que essa arquitetura busca alcançar.

Essa arquitetura é parte do motivo pelo qual os modelos mais capazes de hoje conseguem ter contagens de parâmetros na casa das centenas de bilhões e ainda assim responder a consultas do dia a dia com uma velocidade e um custo que seriam inviáveis se cada parâmetro fosse usado em cada resposta.

▶ Quration Play

tech

Como se chama esse material de treinamento gerado por IA?Como se chama a segunda abordagem, a de treinar com exemplos?Como essa 'marca d'água' de texto geralmente funciona?Como se chama essa técnica de treinamento?Como se chama essa técnica de compressão?Como se chamam os modelos de IA que lidam com vários tipos de entrada ao mesmo tempo?Qual empresa opera esse serviço comercial de robotáxi totalmente sem motorista?Na conhecida escala SAE, qual é o número de nível mais alto, que representa a automação total?Qual é o nome do robô humanoide apresentado pela montadora Tesla?Qual empresa foi pioneira nesse serviço de entrega médica por drones na África?Os robôs de armazém da Amazon nasceram da compra, em 2012, de qual fabricante de robôs?Qual é o nome do robô cirúrgico muito usado, fabricado pela Intuitive Surgical?

Quration — Quration Play