Fundamentos

RAG, fine-tuning ou prompt: qual escolher, com o custo e o esforço de cada caminho

Três caminhos para fazer a IA trabalhar com o seu negócio. A maioria dos projetos escolhe o mais caro por não conhecer a pergunta que separa os três.

Rodrigo Fávaro, fundador da ROO3
Rodrigo Fávaro Fundador da ROO3
·9 min de leitura
Ilustração abstrata de três caminhos partindo de um mesmo ponto, com um deles destacado em verde neon sobre fundo preto.
Resposta direta

A pergunta que decide é o que está faltando. Se falta instrução, o problema se resolve no prompt. Se falta informação que muda com o tempo, a resposta é RAG. Se falta um comportamento consistente que você não consegue descrever em texto, como um formato muito específico ou um estilo próprio, aí o fine-tuning se justifica. Na prática, a maior parte dos casos empresariais para no prompt ou no RAG, e o fine-tuning é a escolha certa em uma minoria pequena.

O que você leva deste artigo

  • Prompt resolve falta de instrução, RAG resolve falta de informação, fine-tuning resolve falta de comportamento.
  • Fine-tuning não é a forma de ensinar fatos ao modelo: para fato, RAG ganha em custo, em prazo e em auditoria.
  • Fine-tuning precisa ser refeito quando o modelo base muda, e o modelo base muda com frequência.
  • A ordem certa é prompt, depois RAG, depois fine-tuning, medindo a cada etapa.
  • Sem um conjunto de perguntas com resposta correta, nenhuma das três opções é avaliável.
  • Os três se combinam: fine-tuning de formato com RAG de conteúdo é um desenho comum.

A pergunta que separa os três

Antes de comparar tecnologias, vale fazer uma pergunta que resolve a maior parte das dúvidas: o que exatamente está faltando na resposta que você recebeu?

Se o modelo respondeu com a informação certa mas no formato errado, no tom errado, longo demais ou sem seguir o passo que você queria, falta instrução. Isso se resolve no prompt, e é grátis.

Se o modelo respondeu bem estruturado mas com informação que não é a da sua empresa, ou inventou um dado que só existe nos seus documentos, falta informação. Isso se resolve com RAG, entregando o material junto da pergunta.

Se o modelo entende a tarefa, tem a informação e ainda assim não acerta o jeito de fazer de forma consistente, e você já tentou explicar isso no prompt de várias formas sem sucesso, aí sim falta comportamento. É o único caso em que o fine-tuning é a resposta certa.

Quase todo projeto que começa perguntando "como treino uma IA com os meus dados?" está na verdade no segundo caso, que é o mais barato dos três.

Falta instrução, falta informação ou falta comportamento? A resposta a essa pergunta é a decisão inteira.

Prompt: a opção que resolve mais do que parece

Prompt é a instrução que você manda junto da pergunta, e inclui exemplos. É a opção mais subestimada porque é grátis e não parece tecnologia, mas é onde está a maior parte do ganho na maior parte dos casos.

A técnica que mais rende aqui é dar exemplos. Duas ou três entradas com a saída exata que você quer ensinam formato, tom e nível de detalhe melhor do que três parágrafos de descrição. É a diferença entre explicar como escrever e mostrar um texto pronto.

A vantagem prática do prompt é a velocidade de iteração. Você muda, testa e vê o resultado em segundos, sem custo de treinamento e sem espera. Nenhuma das outras duas opções oferece isso, e isso importa mais do que parece quando você ainda não sabe exatamente o que quer.

O limite aparece quando a instrução fica gigante. Um prompt de várias páginas é caro, porque viaja em toda chamada, e fica frágil, porque instruções demais começam a competir entre si e o modelo passa a ignorar parte delas. Quando você chega nesse ponto, é sinal de que passou da hora de olhar as outras opções. As técnicas estão detalhadas em como escrever um bom prompt.

RAG: quando o que falta é informação

RAG busca os trechos relevantes nos seus documentos e entrega junto com a pergunta. É a escolha certa sempre que a resposta depende de informação que é sua, que muda, ou que é grande demais para caber numa instrução fixa.

Três características tornam o RAG difícil de bater nesse cenário. A primeira é a atualização: mudou o documento, mudou a resposta na próxima pergunta, sem retreinamento e sem espera. A segunda é a auditoria: a resposta pode citar o trecho de origem, o que torna a conferência rápida e permite discutir a resposta com quem entende do assunto.

A terceira é o controle de acesso. Como a busca acontece antes, você filtra o que aquele usuário pode ver antes de o modelo receber qualquer coisa. Num modelo ajustado por fine-tuning, a informação está diluída nos pesos e não há filtro possível: quem tem acesso ao modelo tem acesso a tudo que entrou nele.

Esse último ponto costuma decidir a escolha em empresa com dado sensível, e ele é o argumento menos citado nos tutoriais. Como o RAG funciona por dentro está em o que é RAG.

Fine-tuning: o que ele realmente faz

Fine-tuning, ou ajuste fino, é pegar um modelo pronto e continuar treinando com exemplos seus, ajustando os pesos. O resultado é um modelo que se comporta de um jeito específico por padrão, sem você precisar explicar toda vez.

O mal-entendido mais caro do mercado está aqui: fine-tuning não é o jeito de ensinar fatos ao modelo. Ele ajusta comportamento, estilo e formato. Fatos específicos entram de forma difusa e não confiável, e você não consegue saber se um fato foi realmente aprendido nem corrigi-lo depois sem retreinar. Para fato, RAG ganha em todas as dimensões que importam.

Onde ele brilha é em três situações. Formato de saída muito rígido e repetitivo, que precisa sair idêntico milhares de vezes. Tom e estilo próprios, difíceis de descrever em palavras mas fáceis de mostrar em cem exemplos. E redução de custo: um modelo pequeno ajustado para uma tarefa estreita pode alcançar a qualidade de um modelo grande naquela tarefa específica, por uma fração do preço e com menos espera.

Esse terceiro caso é o que mais se paga em produção, e é justamente o menos falado. Se você roda a mesma tarefa mecânica um milhão de vezes por mês, ajustar um modelo pequeno para ela pode transformar a economia do projeto inteiro.

O custo real de cada caminho

Comparar só o preço de treinamento engana, porque o custo dominante do fine-tuning não é ele. É a preparação e a manutenção.

No prompt, o custo é o seu tempo de escrever e testar, mais os tokens da instrução em cada chamada. Iteração em minutos. Manutenção quase nula: mudou a regra, você edita um texto.

No RAG, o custo é montar a infraestrutura de busca, preparar os documentos e manter a base limpa. A parte cara e chata é a limpeza: decidir qual versão de cada documento vale, converter o que está em imagem e escrever o que nunca foi documentado. Manutenção contínua, mas simples de delegar.

No fine-tuning, o custo começa em preparar de centenas a milhares de exemplos de qualidade, o que é trabalho humano especializado e não dá para terceirizar barato. Depois vem o treinamento, o teste e a hospedagem. E vem a manutenção que quase ninguém orça: quando o modelo base ganha versão nova, o seu ajuste não vem junto. Ou você fica preso a um modelo que envelhece, ou refaz o processo. Modelos base mudam com frequência, e isso é um custo recorrente disfarçado de investimento único.

A ordem certa, e por que ela economiza dinheiro

A sequência que funciona é sempre a mesma, e ela é desenhada para você descobrir cedo que não precisa da etapa seguinte.

Passo zero, e nenhum dos três funciona sem ele: monte um conjunto de vinte a cinquenta perguntas reais com a resposta correta ao lado, escritas por quem entende do assunto. Sem isso, você não tem como saber se uma mudança melhorou ou piorou, e o projeto anda por opinião de quem falou por último.

Passo um: resolva com prompt, incluindo exemplos. Meça contra o conjunto. Muita coisa que parecia exigir treinamento para aqui, e para em uma tarde.

Passo dois: se o que falta é informação sua, monte o RAG. Meça de novo. A maioria dos projetos empresariais termina aqui, com resultado bom e custo previsível.

Passo três: só se sobrar um problema de comportamento consistente, ou uma necessidade clara de reduzir custo em volume alto, avalie o fine-tuning. E entre nele sabendo que assumiu uma manutenção recorrente.

Os três juntos, que é como costuma terminar

Na prática, sistemas maduros não escolhem um: eles usam cada peça para o que ela faz melhor, e o desenho fica claro depois que você separa as três perguntas.

Um exemplo concreto de como isso se combina: uma empresa que emite milhares de laudos padronizados por mês pode usar fine-tuning para o formato do laudo sair exatamente igual todas as vezes, RAG para trazer as normas técnicas aplicáveis a cada caso e prompt para ajustar o nível de detalhe conforme o destinatário. Três camadas, três problemas diferentes.

O erro simétrico também existe e é caro: usar RAG para tudo, inclusive para coisas que o prompt resolveria, adiciona latência, custo e complexidade sem ganho. Nem toda pergunta precisa de busca.

E vale registrar a regra que evita a maior parte do desperdício: não comece pelo caminho mais caro por medo de que o mais barato não funcione. Testar o prompt custa uma tarde. Descobrir depois de três meses de fine-tuning que o prompt resolvia custa o projeto.

Se você está nessa decisão agora e quer que alguém olhe o caso concreto antes de você comprometer orçamento, é exatamente isso que a consultoria em IA da ROO3 faz na primeira etapa: definir qual das três perguntas é a sua, antes de escrever qualquer linha de código.

Perguntas frequentes

Qual a diferença entre RAG e fine-tuning?

RAG entrega informação junto da pergunta e deixa o modelo intacto, então atualizar é trocar um arquivo e a resposta pode citar a origem. Fine-tuning altera os pesos do modelo para mudar comportamento e estilo, e não é forma confiável de ensinar fatos específicos.

Fine-tuning ensina fatos ao modelo?

Não de forma confiável. Fatos entram de maneira difusa, você não consegue verificar se um fato específico foi aprendido nem corrigi-lo sem retreinar, e a resposta não cita fonte. Para fato, RAG é melhor em custo, prazo e auditoria.

Quando o fine-tuning vale a pena?

Em três casos: formato de saída muito rígido e repetitivo, tom ou estilo difíceis de descrever em palavras mas fáceis de mostrar em exemplos, e redução de custo em volume alto, ajustando um modelo pequeno para uma tarefa estreita em vez de usar um modelo grande.

Quantos exemplos preciso para fazer fine-tuning?

Depende da tarefa, mas o pedido costuma partir de centenas e chegar a milhares de exemplos de boa qualidade. O custo dominante é preparar esses exemplos, o que exige gente que entende do assunto, e não o treinamento em si.

Preciso refazer o fine-tuning quando sai um modelo novo?

Sim, se quiser aproveitar o modelo novo. O ajuste é feito sobre um modelo base específico e não migra automaticamente. Como modelos base mudam com frequência, isso é um custo recorrente que precisa entrar no orçamento desde o começo.

Dá para usar os três juntos?

Sim, e sistemas maduros geralmente usam. Um desenho comum é fine-tuning cuidando do formato de saída, RAG trazendo o conteúdo atualizado e prompt ajustando o tom conforme o caso. Cada camada resolve um tipo diferente de falta.

Fontes
Rodrigo Fávaro

Rodrigo Fávaro

Fundador da ROO3, agência de marketing e tecnologia em São José do Rio Preto. Constrói produtos com IA em produção (Tobia, gerar.app, Pense Mercado) e mantém o AI Benchmark, ranking público de modelos de IA. Veja a consultoria em IA da ROO3.

X @rodmf LinkedIn rodrigofavaro

Quer aplicar isso na sua empresa?

A ROO3 faz o diagnóstico do que dá para automatizar primeiro no seu negócio. A conversa inicial é gratuita.