A pergunta chega toda semana: precisamos de fine-tuning, de RAG ou de prompt engineering? Responda com árvore de decisão, porque o custo sobe em degraus: prompting custa horas, RAG custa dezenas de milhares, fine-tuning custa ciclos de retreino.

Comece pelo prompt engineering

Prompting resolve a maioria dos casos a custo perto de zero: horas de trabalho e loops de iteração de minutos. Esgote o caminho antes de subir o degrau. Poucos few-shots bem escolhidos, estrutura de saída explícita e system prompt versionado no repo entregam mais que muito curso por aí.

RAG resolve problema de conhecimento

Sintomas: o modelo desconhece seus dados internos, a base muda toda semana, o usuário exige citação com fonte. Esse trio pede recuperação. Build inicial entre $10k e $50k (pipeline de ingestão, chunking, embedding, busca híbrida) e operação de $2k a $10k por mês conforme volume e frequência de reindexação.

Fine-tuning resolve problema de comportamento

Sintomas espelhados: formato de saída rígido, tom de marca, vocabulário de domínio, latência menor via destilação em modelos compactos. Treino ajusta como o modelo responde. Fato é outra história: conhecimento treinado produz alucinação confiante, o modelo repete o padrão e erra o conteúdo. Conhecimento mora na recuperação; comportamento mora nos pesos.

A escada de custos

  • Prompt engineering: $0-5k, iteração em horas, zero infraestrutura
  • RAG: $10-50k de build mais $2-10k/mês de pipeline e operação de busca
  • Fine-tuning: $15-100k entre dados curados, treino e evals, com retreino quando o comportamento derivar

A árvore de decisão

  1. Dado privado ou corrente? RAG.
  2. Formato ou estilo rígido? Fine-tuning.
  3. Os dois? RAG primeiro, destilação depois.
  4. Nenhum dos dois? Fique no prompting e invista em evals.

O modo de falha clássico

Time injeta conhecimento por fine-tune para pular a pipeline de retrieval. O modelo passa a alucinar com confiança dobrada e ninguém rastreia a origem de cada afirmação. Citação com fonte exige recuperação; treino não dá atalho. Quando tentar economizar $20k de pipeline custa a credibilidade do produto inteiro, a conta não fecha.