Projeto 01 · Em andamento
LLMs compactos para a indústria automotivaTriagem de reclamações de defeitos e assistente de patentes
Modelos de linguagem com menos de 7 bilhões de parâmetros, ajustados com LoRA em uma GPU de 6 GB e aplicados a duas tarefas reais: classificar reclamações de defeitos veiculares registradas na NHTSA, a agência de segurança viária dos EUA, e orientar sobre patentes no Brasil com base em documentos oficiais do INPI.
Nada aqui é simulado: respostas e previsões vêm dos experimentos. Os LLMs não rodam neste site; o classificador de reclamações, sim, roda no seu navegador.
01
Triagem de reclamações de defeitos
Descreva um defeito em português, inglês ou alemão. Um classificador TF-IDF com regressão logística indica o componente afetado. Ele roda no seu navegador (1,1 MB; nada é enviado) e é a referência que os LLMs do estudo precisam superar.
Reclamações reais e o que cada modelo previu
Reclamações reais do conjunto de avaliação (2014–2024). Os modelos classificaram o texto original em inglês; a tradução foi feita à mão para esta página.
02
Assistente de patentes
Faça uma pergunta sobre patentes no Brasil. Ela é comparada às 52 perguntas de teste, que os modelos nunca viram no treino. Você vê os trechos oficiais que cada modelo recebeu, a resposta de referência e o que cada modelo respondeu antes e depois do ajuste fino.
…
Orientação geral com base em documentos públicos; não é parecer jurídico.
03
Resultados
Conjuntos de teste fixos, separados antes de qualquer ajuste.
| Modelo | Etapa | Acurácia 2014–2024 | F1 macro 2014–2024 | F1 macro 1994–2013 | Reclamações/s |
|---|
| Modelo | Etapa | ROUGE-L | F1 | Cita a fonte | Apoio nos trechos | IPC: acurácia |
|---|
- As reclamações de 1994–2013 usam a nomenclatura antiga de componentes da NHTSA; ali, a queda de desempenho mede o efeito do deslocamento temporal.
- O teste de perguntas e respostas tem 52 itens: diferenças de poucos pontos não são conclusivas.
- ROUGE-L e F1 favorecem respostas extrativas e não medem a correção jurídica; uma amostra será avaliada por especialista em propriedade intelectual.
04
Como foi feito
- Dados reais e verificáveis: 12.534 reclamações públicas da NHTSA; 490 perguntas e respostas extraídas da Lei 9.279/1996 e de manuais, diretrizes e estudos do INPI, com cada trecho conferido literalmente com a fonte; e 694 pedidos de patente reais.
- RAG e ajuste fino: o modelo recebe os três trechos oficiais mais relevantes, recuperados por BM25, e aprende a responder com base neles e a citar a fonte.
- LoRA em uma GPU de 6 GB; modelos acima de 3 bilhões de parâmetros em QLoRA de 4 bits. A taxa de aprendizado é escolhida na validação, e o número de épocas, por parada antecipada.
- Cada tarefa tem uma referência sem LLM, para medir se o modelo de linguagem compensa o custo.