RAG, fine-tuning ou prompt: qual escolher, com o custo e o esforço de cada caminho
Três caminhos para fazer a IA trabalhar com o seu negócio. A maioria dos projetos escolhe o mais caro por não conhecer a pergunta que separa os três.
A pergunta que decide é o que está faltando. Se falta instrução, o problema se resolve no prompt. Se falta informação que muda com o tempo, a resposta é RAG. Se falta um comportamento consistente que você não consegue descrever em texto, como um formato muito específico ou um estilo próprio, aí o fine-tuning se justifica. Na prática, a maior parte dos casos empresariais para no prompt ou no RAG, e o fine-tuning é a escolha certa em uma minoria pequena.
O que você leva deste artigo
- Prompt resolve falta de instrução, RAG resolve falta de informação, fine-tuning resolve falta de comportamento.
- Fine-tuning não é a forma de ensinar fatos ao modelo: para fato, RAG ganha em custo, em prazo e em auditoria.
- Fine-tuning precisa ser refeito quando o modelo base muda, e o modelo base muda com frequência.
- A ordem certa é prompt, depois RAG, depois fine-tuning, medindo a cada etapa.
- Sem um conjunto de perguntas com resposta correta, nenhuma das três opções é avaliável.
- Os três se combinam: fine-tuning de formato com RAG de conteúdo é um desenho comum.
A pergunta que separa os três
Antes de comparar tecnologias, vale fazer uma pergunta que resolve a maior parte das dúvidas: o que exatamente está faltando na resposta que você recebeu?
Se o modelo respondeu com a informação certa mas no formato errado, no tom errado, longo demais ou sem seguir o passo que você queria, falta instrução. Isso se resolve no prompt, e é grátis.
Se o modelo respondeu bem estruturado mas com informação que não é a da sua empresa, ou inventou um dado que só existe nos seus documentos, falta informação. Isso se resolve com RAG, entregando o material junto da pergunta.
Se o modelo entende a tarefa, tem a informação e ainda assim não acerta o jeito de fazer de forma consistente, e você já tentou explicar isso no prompt de várias formas sem sucesso, aí sim falta comportamento. É o único caso em que o fine-tuning é a resposta certa.
Quase todo projeto que começa perguntando "como treino uma IA com os meus dados?" está na verdade no segundo caso, que é o mais barato dos três.
Falta instrução, falta informação ou falta comportamento? A resposta a essa pergunta é a decisão inteira.
Prompt: a opção que resolve mais do que parece
Prompt é a instrução que você manda junto da pergunta, e inclui exemplos. É a opção mais subestimada porque é grátis e não parece tecnologia, mas é onde está a maior parte do ganho na maior parte dos casos.
A técnica que mais rende aqui é dar exemplos. Duas ou três entradas com a saída exata que você quer ensinam formato, tom e nível de detalhe melhor do que três parágrafos de descrição. É a diferença entre explicar como escrever e mostrar um texto pronto.
A vantagem prática do prompt é a velocidade de iteração. Você muda, testa e vê o resultado em segundos, sem custo de treinamento e sem espera. Nenhuma das outras duas opções oferece isso, e isso importa mais do que parece quando você ainda não sabe exatamente o que quer.
O limite aparece quando a instrução fica gigante. Um prompt de várias páginas é caro, porque viaja em toda chamada, e fica frágil, porque instruções demais começam a competir entre si e o modelo passa a ignorar parte delas. Quando você chega nesse ponto, é sinal de que passou da hora de olhar as outras opções. As técnicas estão detalhadas em como escrever um bom prompt.
RAG: quando o que falta é informação
RAG busca os trechos relevantes nos seus documentos e entrega junto com a pergunta. É a escolha certa sempre que a resposta depende de informação que é sua, que muda, ou que é grande demais para caber numa instrução fixa.
Três características tornam o RAG difícil de bater nesse cenário. A primeira é a atualização: mudou o documento, mudou a resposta na próxima pergunta, sem retreinamento e sem espera. A segunda é a auditoria: a resposta pode citar o trecho de origem, o que torna a conferência rápida e permite discutir a resposta com quem entende do assunto.
A terceira é o controle de acesso. Como a busca acontece antes, você filtra o que aquele usuário pode ver antes de o modelo receber qualquer coisa. Num modelo ajustado por fine-tuning, a informação está diluída nos pesos e não há filtro possível: quem tem acesso ao modelo tem acesso a tudo que entrou nele.
Esse último ponto costuma decidir a escolha em empresa com dado sensível, e ele é o argumento menos citado nos tutoriais. Como o RAG funciona por dentro está em o que é RAG.
Fine-tuning: o que ele realmente faz
Fine-tuning, ou ajuste fino, é pegar um modelo pronto e continuar treinando com exemplos seus, ajustando os pesos. O resultado é um modelo que se comporta de um jeito específico por padrão, sem você precisar explicar toda vez.
O mal-entendido mais caro do mercado está aqui: fine-tuning não é o jeito de ensinar fatos ao modelo. Ele ajusta comportamento, estilo e formato. Fatos específicos entram de forma difusa e não confiável, e você não consegue saber se um fato foi realmente aprendido nem corrigi-lo depois sem retreinar. Para fato, RAG ganha em todas as dimensões que importam.
Onde ele brilha é em três situações. Formato de saída muito rígido e repetitivo, que precisa sair idêntico milhares de vezes. Tom e estilo próprios, difíceis de descrever em palavras mas fáceis de mostrar em cem exemplos. E redução de custo: um modelo pequeno ajustado para uma tarefa estreita pode alcançar a qualidade de um modelo grande naquela tarefa específica, por uma fração do preço e com menos espera.
Esse terceiro caso é o que mais se paga em produção, e é justamente o menos falado. Se você roda a mesma tarefa mecânica um milhão de vezes por mês, ajustar um modelo pequeno para ela pode transformar a economia do projeto inteiro.
O custo real de cada caminho
Comparar só o preço de treinamento engana, porque o custo dominante do fine-tuning não é ele. É a preparação e a manutenção.
No prompt, o custo é o seu tempo de escrever e testar, mais os tokens da instrução em cada chamada. Iteração em minutos. Manutenção quase nula: mudou a regra, você edita um texto.
No RAG, o custo é montar a infraestrutura de busca, preparar os documentos e manter a base limpa. A parte cara e chata é a limpeza: decidir qual versão de cada documento vale, converter o que está em imagem e escrever o que nunca foi documentado. Manutenção contínua, mas simples de delegar.
No fine-tuning, o custo começa em preparar de centenas a milhares de exemplos de qualidade, o que é trabalho humano especializado e não dá para terceirizar barato. Depois vem o treinamento, o teste e a hospedagem. E vem a manutenção que quase ninguém orça: quando o modelo base ganha versão nova, o seu ajuste não vem junto. Ou você fica preso a um modelo que envelhece, ou refaz o processo. Modelos base mudam com frequência, e isso é um custo recorrente disfarçado de investimento único.
- Prompt: horas de trabalho, iteração em minutos, manutenção por edição de texto.
- RAG: semanas de montagem, custo maior na limpeza dos documentos do que na tecnologia.
- Fine-tuning: centenas a milhares de exemplos preparados por gente que entende do assunto, mais retrabalho a cada troca de modelo base.
A ordem certa, e por que ela economiza dinheiro
A sequência que funciona é sempre a mesma, e ela é desenhada para você descobrir cedo que não precisa da etapa seguinte.
Passo zero, e nenhum dos três funciona sem ele: monte um conjunto de vinte a cinquenta perguntas reais com a resposta correta ao lado, escritas por quem entende do assunto. Sem isso, você não tem como saber se uma mudança melhorou ou piorou, e o projeto anda por opinião de quem falou por último.
Passo um: resolva com prompt, incluindo exemplos. Meça contra o conjunto. Muita coisa que parecia exigir treinamento para aqui, e para em uma tarde.
Passo dois: se o que falta é informação sua, monte o RAG. Meça de novo. A maioria dos projetos empresariais termina aqui, com resultado bom e custo previsível.
Passo três: só se sobrar um problema de comportamento consistente, ou uma necessidade clara de reduzir custo em volume alto, avalie o fine-tuning. E entre nele sabendo que assumiu uma manutenção recorrente.
Os três juntos, que é como costuma terminar
Na prática, sistemas maduros não escolhem um: eles usam cada peça para o que ela faz melhor, e o desenho fica claro depois que você separa as três perguntas.
Um exemplo concreto de como isso se combina: uma empresa que emite milhares de laudos padronizados por mês pode usar fine-tuning para o formato do laudo sair exatamente igual todas as vezes, RAG para trazer as normas técnicas aplicáveis a cada caso e prompt para ajustar o nível de detalhe conforme o destinatário. Três camadas, três problemas diferentes.
O erro simétrico também existe e é caro: usar RAG para tudo, inclusive para coisas que o prompt resolveria, adiciona latência, custo e complexidade sem ganho. Nem toda pergunta precisa de busca.
E vale registrar a regra que evita a maior parte do desperdício: não comece pelo caminho mais caro por medo de que o mais barato não funcione. Testar o prompt custa uma tarde. Descobrir depois de três meses de fine-tuning que o prompt resolvia custa o projeto.
Se você está nessa decisão agora e quer que alguém olhe o caso concreto antes de você comprometer orçamento, é exatamente isso que a consultoria em IA da ROO3 faz na primeira etapa: definir qual das três perguntas é a sua, antes de escrever qualquer linha de código.
Perguntas frequentes
Qual a diferença entre RAG e fine-tuning?
RAG entrega informação junto da pergunta e deixa o modelo intacto, então atualizar é trocar um arquivo e a resposta pode citar a origem. Fine-tuning altera os pesos do modelo para mudar comportamento e estilo, e não é forma confiável de ensinar fatos específicos.
Fine-tuning ensina fatos ao modelo?
Não de forma confiável. Fatos entram de maneira difusa, você não consegue verificar se um fato específico foi aprendido nem corrigi-lo sem retreinar, e a resposta não cita fonte. Para fato, RAG é melhor em custo, prazo e auditoria.
Quando o fine-tuning vale a pena?
Em três casos: formato de saída muito rígido e repetitivo, tom ou estilo difíceis de descrever em palavras mas fáceis de mostrar em exemplos, e redução de custo em volume alto, ajustando um modelo pequeno para uma tarefa estreita em vez de usar um modelo grande.
Quantos exemplos preciso para fazer fine-tuning?
Depende da tarefa, mas o pedido costuma partir de centenas e chegar a milhares de exemplos de boa qualidade. O custo dominante é preparar esses exemplos, o que exige gente que entende do assunto, e não o treinamento em si.
Preciso refazer o fine-tuning quando sai um modelo novo?
Sim, se quiser aproveitar o modelo novo. O ajuste é feito sobre um modelo base específico e não migra automaticamente. Como modelos base mudam com frequência, isso é um custo recorrente que precisa entrar no orçamento desde o começo.
Dá para usar os três juntos?
Sim, e sistemas maduros geralmente usam. Um desenho comum é fine-tuning cuidando do formato de saída, RAG trazendo o conteúdo atualizado e prompt ajustando o tom conforme o caso. Cada camada resolve um tipo diferente de falta.
Rodrigo Fávaro
Fundador da ROO3, agência de marketing e tecnologia em São José do Rio Preto. Constrói produtos com IA em produção (Tobia, gerar.app, Pense Mercado) e mantém o AI Benchmark, ranking público de modelos de IA. Veja a consultoria em IA da ROO3.
X @rodmf LinkedIn rodrigofavaroContinue lendo

O que é RAG e por que ele é a forma mais barata de usar IA
O que é RAG explicado de forma prática: como funciona a busca antes da resposta, quando ele resolve, o que ele não...
10 min de leitura
Como escrever um bom prompt: o método que funciona
O método para escrever prompts que funcionam: o que colocar, em que ordem, e a comparação entre pedidos ruins e bons...
10 min de leitura
Token e janela de contexto: por que a conta da IA vem alta
O que é token, o que é janela de contexto e como a cobrança funciona de verdade. Com a conta feita e os quatro erros...
11 min de leituraQuer aplicar isso na sua empresa?
A ROO3 faz o diagnóstico do que dá para automatizar primeiro no seu negócio. A conversa inicial é gratuita.