Quando falamos de IA generativa, quase sempre estamos falando de um modelo de linguagem, como o ChatGPT, o Claude, o Gemini. As famosas LLMs, que são ótimas, mas nem sempre são o jeito mais eficiente de resolver um problema. Em setembro apareceu um modelo que deixa isso bem claro.
De forma simples, as LLM funcionam assim: você manda um texto, ela "pensa" por texto e devolve outro texto, escrito palavra por palavra. Pode ser em português, inglês ou qualquer linguagem de programação. É por isso que ele serve pra quase tudo. De resumir contrato até criar jogos e aplicativos.
Até aí tudo bem. Só que nem sempre é isso que a gente precisa. Muitas vezes a gente só quer um sim ou não e ele lá nos mandando textão. Pergunta “esse e-mail é reclamação?” e ele monta uma frase inteira pra responder. Você paga, em tempo e em tokens (ou crédito de API) por todo processo.
Pra uma pergunta só, tudo bem, não tem grandes problemas. Mas e quando queremos avaliar dez mil por dia? É tempo e dinheiro indo embora para nada.