Voltar aos projetos

Projeto 01 · Em andamento

LLMs compactos para a indústria automotivaTriagem de reclamações de defeitos e assistente de patentes

Modelos de linguagem com menos de 7 bilhões de parâmetros, ajustados com LoRA em uma GPU de 6 GB e aplicados a duas tarefas reais: classificar reclamações de defeitos veiculares registradas na NHTSA, a agência de segurança viária dos EUA, e orientar sobre patentes no Brasil com base em documentos oficiais do INPI.

Nada aqui é simulado: respostas e previsões vêm dos experimentos. Os LLMs não rodam neste site; o classificador de reclamações, sim, roda no seu navegador.

01

Triagem de reclamações de defeitos

Descreva um defeito em português, inglês ou alemão. Um classificador TF-IDF com regressão logística indica o componente afetado. Ele roda no seu navegador (1,1 MB; nada é enviado) e é a referência que os LLMs do estudo precisam superar.

Exemplos:

Reclamações reais e o que cada modelo previu

Reclamações reais do conjunto de avaliação (2014–2024). Os modelos classificaram o texto original em inglês; a tradução foi feita à mão para esta página.

02

Assistente de patentes

Faça uma pergunta sobre patentes no Brasil. Ela é comparada às 52 perguntas de teste, que os modelos nunca viram no treino. Você vê os trechos oficiais que cada modelo recebeu, a resposta de referência e o que cada modelo respondeu antes e depois do ajuste fino.

…

Orientação geral com base em documentos públicos; não é parecer jurídico.

03

Resultados

Conjuntos de teste fixos, separados antes de qualquer ajuste.

Triagem NHTSA: 2.089 reclamações de 2014–2024 (avaliação principal) e 2.089 de 1994–2013 (deslocamento temporal)
ModeloEtapaAcurácia 2014–2024F1 macro 2014–2024F1 macro 1994–2013Reclamações/s
Assistente de patentes: 52 perguntas de teste (resposta com RAG) e 104 pedidos reais (classificação pela IPC)
ModeloEtapaROUGE-LF1Cita a fonteApoio nos trechosIPC: acurácia
  • As reclamações de 1994–2013 usam a nomenclatura antiga de componentes da NHTSA; ali, a queda de desempenho mede o efeito do deslocamento temporal.
  • O teste de perguntas e respostas tem 52 itens: diferenças de poucos pontos não são conclusivas.
  • ROUGE-L e F1 favorecem respostas extrativas e não medem a correção jurídica; uma amostra será avaliada por especialista em propriedade intelectual.

04

Como foi feito

  • Dados reais e verificáveis: 12.534 reclamações públicas da NHTSA; 490 perguntas e respostas extraídas da Lei 9.279/1996 e de manuais, diretrizes e estudos do INPI, com cada trecho conferido literalmente com a fonte; e 694 pedidos de patente reais.
  • RAG e ajuste fino: o modelo recebe os três trechos oficiais mais relevantes, recuperados por BM25, e aprende a responder com base neles e a citar a fonte.
  • LoRA em uma GPU de 6 GB; modelos acima de 3 bilhões de parâmetros em QLoRA de 4 bits. A taxa de aprendizado é escolhida na validação, e o número de épocas, por parada antecipada.
  • Cada tarefa tem uma referência sem LLM, para medir se o modelo de linguagem compensa o custo.