AI

IA Open Source: os 8 Melhores Modelos Abertos e Como Rodar Cada Um [2026]

Time da MarfinTime da Marfin29 min de leitura
IA Open Source: os 8 Melhores Modelos Abertos e Como Rodar Cada Um [2026]

TL;DR

  • A melhor IA open source para a maioria das empresas em 2026 é o DeepSeek V4 Flash via API: licença MIT, janela de 1 milhão de tokens e US$ 0,14 por milhão de tokens de entrada.

Levar para a IA

Leve este artigo para o ChatGPT, o Claude ou a sua IA preferida.

IA open source é o nome que o mercado dá aos modelos de inteligência artificial com pesos abertos: você baixa o arquivo, roda no seu hardware ou no provedor que preferir, ajusta para o seu domínio e embute no seu produto sem pedir licença a ninguém. Se a pergunta é qual usar hoje, a resposta curta que nós damos na Marfin é esta: DeepSeek V4 Flash para volume via API, Qwen ou gpt-oss para rodar no próprio computador, e Kimi K3 ou GLM-5.3 quando você precisa do teto de qualidade aberto e aceita consumir por provedor.

O ano de 2026 mexeu no tabuleiro inteiro. A DeepSeek publicou a linha V4 sob licença MIT com janela de 1 milhão de tokens, a Moonshot soltou os pesos do Kimi K3 com 2,8 trilhões de parâmetros, a Mistral colocou até o modelo grande dela em Apache 2.0, e a Meta, que por anos foi a porta-bandeira dos pesos abertos com o Llama, sinalizou que o próximo modelo de fronteira dela sai fechado. Ao mesmo tempo, o preço por token dos modelos abertos servidos por terceiros caiu para uma fração do que se cobra pelos fechados, e isso mexeu na conta de qualquer operação que roda IA em escala.

Nós testamos a maior parte desses modelos em uso real: extração de dados de páginas, classificação de leads, rascunho de conteúdo, transcrição enriquecida e automações internas que rodam milhares de vezes por dia. Este guia junta o que aprendemos: o que é IA open source de fato e onde o termo engana, os oito modelos que valem sua atenção, como eles se comparam aos fechados, como rodar cada um (no notebook, via API ou em servidor próprio), quanto custa e dez recomendações para colocar em produção sem queimar orçamento. Se você quer o panorama completo antes de entrar nos modelos abertos, nosso guia completo de inteligência artificial cobre conceitos, famílias de modelos e casos de uso.

Qual a melhor IA open source em 2026: a resposta por caso de uso

A escolha depende de três perguntas: onde o modelo vai rodar, quanto volume ele vai processar e o que a licença precisa permitir. Com essas três respostas na mão, a decisão fica curta, e quem promete um vencedor único para todos os casos está simplificando demais.

Para uso geral via API com custo mínimo, o DeepSeek V4 Flash é a nossa recomendação padrão. Ele sai por US$ 0,14 por milhão de tokens de entrada e US$ 0,28 por milhão de saída na API oficial, aceita 1 milhão de tokens de contexto e vem sob MIT, a licença mais livre do grupo. Para classificação, extração, resumo e primeira versão de texto, a qualidade sobra e a conta quase some.

Para o teto de qualidade entre os abertos, a disputa em setembro de 2026 está entre o GLM-5.3, da Zhipu, o Kimi K3, da Moonshot, e o DeepSeek V4 Pro. No índice de inteligência da Artificial Analysis consultado no começo de setembro, o GLM-5.3 aparecia como o aberto mais bem colocado, com o Kimi K3 logo atrás. São modelos para agentes, código e tarefas longas, e nenhum deles cabe numa máquina comum.

Para rodar no seu computador, olhe para a faixa de 20 a 30 bilhões de parâmetros. O Qwen de 27 bilhões, o gpt-oss-20b da OpenAI, o Mistral Small de 24 bilhões e o Gemma de 27 bilhões do Google rodam quantizados em uma placa de vídeo de 24 GB ou num Mac com 32 GB de memória unificada, com resposta boa em português. O gpt-oss-20b desce ainda mais e roda em notebook com 16 GB.

Para licença sem dor de cabeça, fique com MIT ou Apache 2.0: DeepSeek, gpt-oss, a maior parte da linha Qwen e quase todo o catálogo atual da Mistral. Llama, Kimi K3, Gemma e os maiores Qwen têm licenças próprias com condições que você precisa ler antes de construir em cima.

O que é IA open source (e onde o termo engana)

Um modelo de linguagem, o que o mercado chama de LLM, tem três partes que poderiam ser abertas: a arquitetura, os pesos treinados e os dados de treinamento. Se o conceito ainda está nebuloso, nosso texto sobre o que é LLM explica do zero como esses modelos funcionam por dentro. Praticamente toda IA open source que aparece nas listas abre a arquitetura e os pesos, e mantém os dados fechados. Na prática, você pode baixar o arquivo, rodar onde quiser, ajustar, quantizar e servir, mas fica sem como reproduzir o treinamento do zero ou auditar exatamente o que entrou na base.

A Open Source Initiative publicou uma definição formal de IA open source que exige informação suficiente sobre os dados para permitir reprodução. Pela régua dela, quase nenhum modelo popular passa. O termo técnico mais honesto para o que existe é "pesos abertos", ou open weights. Nós usamos "open source" no sentido corrente do mercado, porque é assim que o termo circula e é assim que as pessoas buscam, mas vale saber a diferença quando alguém do jurídico perguntar.

Pesos abertos, dados fechados, e o que isso significa na prática

Para quem constrói produto, a distinção que decide é o que a licença deixa você fazer. Você pode usar comercialmente? Pode oferecer o modelo como serviço para terceiros? Pode treinar outro modelo com as saídas dele? Precisa dar crédito? Existe teto de usuários? Essas respostas mudam de família para família e mudam entre versões da mesma família.

O segundo ponto prático é que peso aberto significa controle real sobre o comportamento. Você congela a versão e ela nunca muda debaixo dos seus pés. Quem já teve um prompt de produção quebrar depois de uma atualização silenciosa de modelo fechado entende o valor disso. Um pipeline que classifica 200 mil registros por mês com regras calibradas em cima de um modelo específico ganha estabilidade quando o modelo mora no seu bucket, longe do roadmap de outra empresa.

As licenças que mudam a sua vida

A DeepSeek libera os pesos sob MIT, que é a licença mais permissiva do grupo: use, modifique, revenda, faça o que quiser. A linha V4 inteira, incluindo o Pro de mais de um trilhão e meio de parâmetros, saiu assim. A OpenAI publicou o gpt-oss sob Apache 2.0, também bastante livre, e o Alibaba mantém Apache 2.0 na maior parte da linha Qwen, com a exceção dos modelos esparsos gigantes, que passaram a sair com licença própria e condições comerciais.

A Mistral foi quem mais abriu nos últimos meses. Até 2025, os modelos maiores dela exigiam acordo comercial para produção. Com o Mistral Large 3, publicado em dezembro de 2025 sob Apache 2.0, e o Mistral Small 4, de março de 2026, praticamente todo o catálogo aberto dela ficou livre para uso comercial.

O Llama usa a Llama Community License, que permite uso comercial com condições: acima de um patamar alto de usuários ativos mensais, você precisa negociar licença separada, produtos derivados carregam obrigação de nome e de crédito, e a política de uso do Llama 4 exclui os direitos multimodais para empresas sediadas na União Europeia. Para a maioria das empresas brasileiras isso fica longe da operação, mas está escrito e alguém vai perguntar. O Kimi K3 trocou a MIT modificada do K2 por uma licença com condições para grandes produtos comerciais e para quem oferece o modelo como serviço, e o Gemma, do Google, tem termos próprios com política de uso aceitável anexada.

Antes de escolher, abra o arquivo de licença do repositório, leia os três parágrafos que decidem o seu caso e guarde uma cópia com data. Leva dez minutos e evita uma conversa desagradável seis meses depois.

DeepSeek V4: o modelo aberto que reescreveu a tabela de preços

A DeepSeek é o caso mais interessante de todos porque combinou três coisas que raramente andam juntas: qualidade de fronteira, licença MIT e preço agressivo. Foi ela que, com a linha V3 e o modelo de raciocínio R1, obrigou o mercado inteiro a rever preço por token. Em 2026, a empresa repetiu a dose com a linha V4: o preview saiu em abril, o V4 Flash chegou oficialmente no fim de julho e o V4 Pro saiu do preview em agosto, com pesos publicados no Hugging Face.

O V4 Pro é o peso pesado, com cerca de 1,6 trilhão de parâmetros totais em mistura de especialistas e janela de 1 milhão de tokens. Nos números divulgados pela própria DeepSeek, ele ficou a poucos décimos do Claude Opus 4.6 no SWE-bench, o que fez dele o primeiro modelo aberto a disputar de verdade com a fronteira fechada em código. O V4 Flash é a versão enxuta, com 284 bilhões de parâmetros totais e uma fração pequena disso ativa por token, pensada para custo e latência.

O impacto no bolso continua sendo o argumento mais forte. Na API oficial, o Flash custa US$ 0,14 por milhão de tokens de entrada e US$ 0,28 por milhão de saída, com desconto grande para entrada que bate no cache. O Pro fica em US$ 1,74 e US$ 3,48. Nesses valores, tarefa que antes nem entrava no orçamento passa a fechar conta: reprocessar um catálogo inteiro, classificar todo o histórico de tickets, rodar avaliação automática em cima de milhares de saídas. Nós migramos rotinas de classificação e extração em lote para a família DeepSeek justamente porque o custo saiu da lista de fatores de decisão.

Os pontos de atenção são reais e você precisa considerá-los antes de mandar dado de cliente. A API oficial roda em infraestrutura na China, o que levanta questões de residência de dados e de conformidade com a LGPD dependendo do contrato que você tem com seus clientes. Existe alinhamento embutido em temas politicamente sensíveis para o país de origem, o que pode ou não afetar seu caso de uso. E a disponibilidade da API oficial já teve períodos instáveis, principalmente nas semanas de lançamento.

A solução prática que nós adotamos: usar os pesos da DeepSeek servidos por provedores ocidentais de inferência, ou rodar dentro da própria nuvem. A licença MIT permite exatamente isso, e é nesse ponto que a escolha de licença passa a pesar como decisão de arquitetura.

Kimi K3 e GLM-5.3: os gigantes abertos que encostaram na fronteira

A ponta de cima do mercado aberto virou território de laboratórios chineses com modelos de mistura de especialistas na casa dos trilhões de parâmetros. Eles são absurdamente capazes e absurdamente pesados, e na prática você os consome via provedor.

O Kimi K3, da Moonshot, teve os pesos publicados no fim de julho de 2026. São 2,8 trilhões de parâmetros totais divididos em centenas de especialistas, com cerca de 104 bilhões ativos por token, janela de 1 milhão de tokens e visão nativa. O download passa de 1,5 TB. É o maior modelo aberto já publicado e um dos mais fortes em tarefas agênticas, com uso intenso de ferramentas e execução em terminal. A licença tem condições para grandes produtos comerciais, então vale a leitura antes de embutir.

O GLM-5.3, da Zhipu, teve os pesos liberados no fim de agosto e apareceu no topo dos abertos no índice da Artificial Analysis no começo de setembro. O foco declarado é código e agentes de desenvolvimento. A versão GLM-5.3-Flash, com 320 bilhões de parâmetros totais e 18 bilhões ativos, sai sob MIT e é, para nós, o gigante com a melhor relação entre qualidade e tranquilidade de licença.

Se o seu caso envolve agentes que navegam repositório, chamam ferramentas e trabalham por muitos passos, esta é a faixa para acompanhar de perto, porque é onde a distância para os modelos fechados mais encolheu. Para rodar próprio, pense em cluster de GPUs de datacenter. Para testar, agregadores como o OpenRouter costumam servir modelos desse porte poucos dias depois do lançamento.

Qwen: a família mais completa para rodar em casa

O Qwen, do Alibaba, virou a escolha padrão de muita gente pela amplitude da linha. Ela vai de modelos minúsculos de menos de um bilhão de parâmetros, que rodam em celular, até misturas de especialistas de trilhões de parâmetros, passando por variantes para visão, para código e para raciocínio. Nenhuma outra família cobre tantos tamanhos com qualidade tão consistente, e o ritmo de atualização é de poucas semanas.

O ponto que mais chama atenção em 2026 são os modelos densos de 27 bilhões. O Alibaba reportou 77,2% no SWE-bench Verified para o Qwen3.6 de 27 bilhões, número que há um ano só aparecia em modelo fechado de ponta. Quantizado em 4 bits, um modelo desse tamanho ocupa algo perto de 17 GB, o que cabe numa placa de consumo de 24 GB ou num Mac com 32 GB. Para quem quer um assistente de código local ou um motor de automação rodando dentro de casa, é hoje o melhor custo-benefício que conhecemos.

Em português, o Qwen se comporta bem, com gramática correta e vocabulário natural, ainda que com um tom um pouco mais formal que os modelos fechados. Para texto que vai direto para o cliente, nós sempre fazemos uma passada de revisão. Para extração, classificação e resumo, ele entrega sem ressalvas.

Llama: o ecossistema mais maduro, com futuro em aberto

A família Llama, da Meta, tem o maior ecossistema em volta, e isso pesa mais que qualquer benchmark isolado. Tudo que você precisa para servir um modelo em produção nasceu com suporte a Llama primeiro: bibliotecas de quantização, runtimes de inferência, ferramentas de fine-tuning, adaptadores LoRA prontos, integrações com bancos vetoriais, documentação em português espalhada por fóruns.

A geração Llama 4 trouxe arquitetura de mistura de especialistas. O Scout ativa cerca de 17 bilhões de parâmetros por token dentro de um total de mais de 100 bilhões, e o Maverick usa o mesmo número de parâmetros ativos com um total bem maior e mais especialistas. Na prática, você paga computação de modelo pequeno com comportamento de modelo grande, desde que tenha memória para carregar tudo. A janela de contexto declarada é gigantesca, e aqui vale um alerta que aprendemos apanhando: contexto declarado e contexto útil são coisas diferentes. A qualidade cai bem antes do limite anunciado em qualquer modelo, aberto ou fechado.

O Llama 3.3 de 70 bilhões continua sendo o melhor cavalo de batalha da família para quem quer rodar próprio. Quantizado em 4 bits, ele cabe em torno de 40 a 48 GB de memória, o que significa uma GPU profissional única, duas placas de consumo top de linha ou um Mac com 64 GB de memória unificada. A resposta é sólida em português, o comportamento é previsível e o volume de material de ajuste fino disponível é enorme.

O futuro da linha é a grande dúvida. Segundo reportagens publicadas desde o fim de 2025, a Meta decidiu que o próximo modelo de fronteira dela, batizado de Avocado, sai fechado e vendido por API, no mesmo modelo de negócio de OpenAI e Anthropic. O Llama 4 continua disponível e com licença válida, mas quem começa um projeto hoje deve contar com a possibilidade de a Meta parar de publicar pesos grandes. Somado ao fato de que os modelos chineses passaram na frente em raciocínio e em código, e costumam custar menos por token nos provedores, o Llama virou para nós uma escolha de ecossistema e de legado, com Qwen e DeepSeek ocupando o lugar de primeira opção.

Mistral: a IA europeia com licença limpa

A Mistral construiu reputação com os modelos pequenos, e em 2026 ampliou a aposta. O Mistral Small 4, de março, junta raciocínio, visão e código agêntico em um único conjunto de pesos sob Apache 2.0: são 119 bilhões de parâmetros totais em mistura de especialistas, com só 6,5 bilhões ativos por token, o que dá latência de modelo pequeno com repertório de modelo médio. O Mistral Large 3, publicado em dezembro de 2025 também em Apache 2.0, tem 675 bilhões de parâmetros totais, 41 bilhões ativos e janela de 256 mil tokens.

Para máquina local, a geração anterior de 24 bilhões de parâmetros continua muito útil. Ela roda bem quantizada em uma única placa de consumo e resolve uma quantidade enorme de trabalho real: reescrita de texto, classificação, extração estruturada, roteamento de intenção, resumo. Em pipelines de automação com milhares de chamadas curtas, o modelo pequeno certo bate o modelo grande genérico em custo e em latência, e a diferença de qualidade some quando a tarefa é bem delimitada.

Para times europeus e para empresas brasileiras com cláusula de residência de dados na União Europeia, a Mistral é a resposta mais direta, porque a infraestrutura e o enquadramento regulatório já vêm resolvidos. Onde ela fica atrás: em benchmarks de fronteira, raramente aparece no topo. A proposta dela é entregar o melhor resultado por watt e por euro, com licença que o jurídico aprova sem discussão.

gpt-oss e Gemma: os modelos abertos das big techs americanas

A OpenAI publicou em agosto de 2025 a linha gpt-oss sob Apache 2.0, o primeiro modelo de pesos abertos dela desde o GPT-2. São dois modelos de raciocínio: o gpt-oss-120b roda em uma única GPU de datacenter de 80 GB, e o gpt-oss-20b cabe em um notebook com 16 GB de memória. Para quem quer raciocínio com cadeia de pensamento dentro de casa e prefere um fornecedor americano por política interna, é a escolha mais direta. Nos nossos testes, o 20b é um dos melhores modelos para notebook comum em tarefas de lógica e de estruturação de dados.

O Gemma, do Google, cobre a faixa de 1 a 27 bilhões de parâmetros com suporte multimodal e foco explícito em rodar em uma única GPU. As versões menores rodam até em celular, o que abre espaço para recurso de IA offline dentro de app. É a opção mais confortável para quem já vive no ecossistema Google Cloud e quer um caminho suave entre o Gemini, fechado, e um modelo aberto da mesma casa.

IA open source vs modelos fechados: onde cada um ganha

Nós somos práticos sobre isso. A ferramenta de programação com IA que mais usamos na Marfin é o Claude Code, rodando o Opus 4.8, e para building no dia a dia usamos o Cursor AI. A comparação completa entre as duas e as concorrentes está no nosso ranking das melhores IDEs com IA. Para engenharia complexa, com muitos arquivos, refatoração longa e uso intenso de ferramentas, os modelos fechados de fronteira ainda entregam uma taxa de acerto que compensa o preço. Um agente que resolve a tarefa de primeira custa menos que três tentativas baratas mais o seu tempo revisando.

Os benchmarks mostram a distância encolhendo, e isso é real. O que eles medem pior é a consistência em tarefas longas: manter o plano por dezenas de passos, se recuperar de erro de ferramenta sem se perder, saber a hora de parar. É nesse tipo de trabalho que o Opus 4.8 continua justificando o preço para nós, com menos erros silenciosos e controle de esforço por tarefa.

A IA open source ganha em quatro situações bem definidas. A primeira é volume alto de tarefas repetitivas e delimitadas, onde a diferença de qualidade some e a diferença de preço multiplica. A segunda é dado que precisa ficar dentro do perímetro, seja por contrato, por LGPD ou por política interna. A terceira é necessidade de comportamento congelado, sem atualização silenciosa. A quarta é quando você precisa de ajuste fino de verdade, com pesos adaptados ao seu domínio, algo que um prompt bem escrito resolve só até certo ponto.

O arranjo que funciona melhor na prática é híbrido, e é o que nós rodamos. Modelo fechado de ponta na camada que exige raciocínio pesado e uso de ferramentas. Modelo aberto pequeno ou médio na camada de volume: classificação, extração, roteamento, primeira triagem, geração de variações. Um roteador simples na frente decide para onde cada requisição vai. Isso derruba o custo total sem mexer na qualidade percebida, e deixa a operação menos dependente de um único fornecedor.

Como rodar IA open source no seu computador, via API ou em servidor

Existem três caminhos, e a escolha entre eles depende de volume, de sensibilidade do dado e de quanto tempo de engenharia você tem para gastar.

No seu computador

Ollama é o caminho mais rápido para começar. Você instala, roda um comando com o nome do modelo, e em minutos tem um endpoint local compatível com o formato de API que a maioria das bibliotecas já entende. LM Studio faz o mesmo com interface gráfica, o que ajuda quem prefere clicar. Por baixo dos dois está o llama.cpp, que popularizou o formato GGUF e as quantizações.

Quantização é o conceito que você precisa entender antes de baixar qualquer coisa. Um modelo em precisão original ocupa cerca de 2 GB por bilhão de parâmetros. Quantizado em 4 bits, cai para algo em torno de 0,6 GB por bilhão, com perda de qualidade que vai de imperceptível a moderada dependendo do método e do tamanho do modelo. A regra prática que nós usamos: em modelos de 7 a 30 bilhões, a quantização de 4 bits de boa qualidade é o ponto de equilíbrio. Em modelos abaixo de 4 bilhões, a perda começa a doer.

O que cabe onde: um notebook com 16 GB de RAM roda modelos de 7 a 8 bilhões com folga e o gpt-oss-20b no limite confortável. Com 32 GB, você chega aos modelos de 24 a 27 bilhões quantizados, a faixa mais interessante de 2026. Um Mac com 64 GB de memória unificada roda um modelo de 70 bilhões quantizado com velocidade boa para trabalho interativo. Com 128 GB, entram o gpt-oss-120b e o Mistral Small 4. Acima disso, você está em território de GPU de datacenter.

Passo a passo: sua primeira IA open source rodando em 15 minutos

O caminho mais curto que conhecemos tem quatro passos. Primeiro, baixe o Ollama no site oficial e instale como qualquer aplicativo; ele funciona em macOS, Windows e Linux. Segundo, abra o terminal e rode ollama run gpt-oss:20b se sua máquina tem 16 GB ou mais, ou ollama run qwen3:8b se ela é mais modesta. O primeiro comando baixa os pesos, o que leva alguns minutos dependendo da conexão, e depois abre um chat direto no terminal.

Terceiro, teste com uma tarefa do seu dia a dia e deixe as perguntas de curiosidade para depois. Cole um e-mail de cliente e peça para classificar a intenção, ou cole uma página de produto e peça os campos em JSON. É assim que você descobre se o modelo serve para o seu caso. Quarto, conecte o modelo ao seu código. O Ollama expõe um servidor local na porta 11434 compatível com o formato de API da OpenAI, então qualquer biblioteca que fala esse formato funciona trocando só o endereço base. A partir daí, trocar de modelo é trocar uma string.

Se o objetivo é conversar com documentos internos, o passo seguinte é juntar o modelo local com busca por trechos relevantes, a técnica de RAG, que resolve a maior parte dos casos de "IA que conhece a minha empresa" sem treinar nada. Com um modelo de 8 a 27 bilhões rodando em casa e uma base de documentos indexada, você tem um assistente interno que nunca manda um byte para fora.

Em API de terceiros

Para a maioria dos casos, esta é a resposta certa, e nós dizemos isso sem meias palavras. Provedores como Together, Fireworks, Groq, DeepInfra e agregadores como o OpenRouter servem os mesmos pesos abertos com endpoint compatível, faturamento por token, escala elástica e nenhuma GPU para você administrar. O custo por token é baixo o suficiente para que comprar hardware só faça sentido em volumes bem altos.

A vantagem escondida aqui é a troca de modelo sem trocar código. Como todos expõem o mesmo formato de API, você aponta uma variável de ambiente para outro modelo e mede a diferença em produção. Nós fazemos isso rotineiramente: mesma tarefa, cinco modelos, comparação de custo, latência e taxa de acerto num conjunto de casos de teste que mantemos versionado. Com lançamento novo saindo a cada poucas semanas, esse hábito paga o próprio tempo várias vezes.

No seu próprio servidor

Quando o volume justifica ou o dado exige, o caminho é vLLM ou SGLang em cima de GPUs suas ou alugadas. Esses runtimes fazem processamento em lote contínuo e gerenciamento inteligente de memória de atenção, o que multiplica a taxa de transferência em relação a rodar de forma ingênua. A conta que fecha a decisão é simples: pegue o custo mensal da instância com GPU, divida pelo número de tokens que você processa por mês e compare com o preço por token do provedor. Abaixo de um certo volume, o provedor sempre ganha, porque ele amortiza a placa entre muitos clientes e você amortiza entre um só.

IA open source é gratuita? O que sai de graça e o que custa

Os pesos são gratuitos: você baixa sem pagar nada. O que custa é a computação para rodar. No seu notebook, o custo é a energia e o tempo da máquina. Num provedor, você paga por token. Em servidor próprio, paga a GPU por hora, esteja ela ocupada ou parada.

Para quem só quer conversar com uma IA open source sem instalar nada, os próprios laboratórios oferecem chat gratuito no navegador: o app da DeepSeek, o Qwen Chat, o Kimi e o Le Chat, da Mistral. É um jeito rápido de sentir a qualidade de cada família antes de investir tempo em integração. O cuidado é o mesmo de qualquer chat na nuvem: o que você digita vai para o servidor da empresa, então nada de dado de cliente, contrato ou planilha financeira ali. Para esse tipo de material, o caminho é o modelo rodando na sua máquina ou na sua nuvem.

Uma nota de realismo: gratuito para baixar tem custo escondido em engenharia. Alguém precisa escolher quantização, manter o servidor, atualizar versão, monitorar latência e medir qualidade. Para uma startup pequena, esse tempo costuma valer mais que a economia de token, e é por isso que nós recomendamos começar pelo provedor.

Fine-tuning, RAG e quando cada um resolve

A confusão mais cara que nós vemos é gente pagando fine-tuning para resolver problema de contexto. As duas técnicas resolvem coisas diferentes, e a ordem de tentativa deveria ser sempre a mesma.

Primeiro, prompt melhor. Boa parte do que parece limitação do modelo se resolve com instrução mais específica, exemplos no prompt e formato de saída definido. O guia de prompt engineering cobre as técnicas que mais rendem, e elas valem tanto para modelo aberto quanto para fechado. Segundo, contexto recuperado: se o modelo precisa saber fatos que ele desconhece, você busca esses fatos e coloca no prompt. Terceiro, e só então, fine-tuning: quando o que você precisa mudar é o comportamento, o formato, o tom ou o vocabulário de domínio, e nenhuma instrução consegue fixar isso de forma confiável.

Aqui a IA open source tem vantagem estrutural clara. Ajustar pesos com LoRA em um modelo de 7 a 14 bilhões custa dezenas de dólares em GPU alugada e algumas horas, e o adaptador resultante é seu, versionável e portátil entre provedores. Você monta o conjunto de treino com algumas centenas a alguns milhares de exemplos bem curados, treina, avalia contra um conjunto separado e compara com o baseline. Sem avaliação medida, fine-tuning vira fé.

Em modelo fechado, o ajuste fino, quando existe, fica preso à plataforma de quem vende. Com pesos abertos, o adaptador vai com você para qualquer provedor ou servidor, e isso muda o seu poder de negociação na hora de renovar contrato.

Preços e planos

Os valores abaixo estão em dólares por milhão de tokens. Para a DeepSeek, usamos o preço da API oficial. Para os demais, a faixa reflete o que os principais provedores de inferência cobram. Preços mudam com frequência e variam por provedor, por quantização e por região, então confirme na origem antes de fechar orçamento.

ModeloLicençaEntradaSaídaMelhor para
DeepSeek V4 FlashMITUS$ 0,14US$ 0,28Volume alto, custo mínimo, contexto longo
DeepSeek V4 ProMITUS$ 1,74US$ 3,48Código e raciocínio perto da fronteira
Llama 4 ScoutCommunity LicenseUS$ 0,15 a 0,40US$ 0,50 a 0,90Uso geral, ecossistema maduro
Llama 4 MaverickCommunity LicenseUS$ 0,20 a 0,60US$ 0,70 a 1,20Tarefas mais pesadas com custo controlado
Qwen3 (MoE grande)Apache 2.0 ou licença própriaUS$ 0,20 a 0,70US$ 0,60 a 2,00Multilíngue, código, uso agêntico
Mistral SmallApache 2.0US$ 0,10 a 0,30US$ 0,30 a 0,90Automação em lote, latência baixa
gpt-oss-120bApache 2.0US$ 0,10 a 0,40US$ 0,40 a 1,20Raciocínio aberto com boa relação custo/qualidade
Modelo fechado de fronteiraProprietáriaUS$ 1,25 a 5US$ 10 a 25Engenharia complexa, agentes longos

Kimi K3 e GLM-5.3 ficaram fora da tabela porque os preços ainda oscilam bastante entre provedores nas semanas seguintes ao lançamento. Para esses dois, a referência mais atualizada é a página do modelo no agregador que você usa.

Rodar próprio muda a estrutura do gasto. Uma instância de nuvem com uma GPU de 80 GB fica na faixa de US$ 2 a 4 por hora sob demanda, o que dá algo entre US$ 1.500 e 3.000 por mês se ficar ligada o tempo todo. Isso só ganha do provedor quando você mantém a placa ocupada de verdade. Se a sua carga é irregular, com picos e vales, o custo por token real dispara porque você paga a GPU parada. Hardware local para desenvolvimento é outra conversa: um Mac com 64 GB ou uma placa de consumo de 24 GB se pagam rápido só em experimentação, sem contar token nenhum.

10 dicas para usar IA open source sem se enrolar

1. Comece pelo provedor e deixe a GPU para depois. Suba a tarefa em API de terceiro, meça o custo real por mês e só então avalie hardware próprio. A maioria dos projetos descobre que a conta do provedor fica menor que a da placa ociosa.

2. Monte um conjunto de avaliação antes de escolher o modelo. Trinta a cinquenta casos reais do seu domínio, com saída esperada anotada. Sem isso, você troca de modelo por impressão, e impressão erra.

3. Use modelo pequeno para tarefa delimitada. Classificar, extrair campo, rotear intenção e reescrever trecho curto dispensam modelo de fronteira. Um modelo de 7 a 27 bilhões bem instruído resolve, e a diferença de custo é de uma a duas ordens de grandeza.

4. Leia a licença antes de construir em cima. MIT e Apache 2.0 liberam praticamente tudo. Licenças comunitárias e próprias trazem condições que podem inviabilizar o seu modelo de negócio, e descobrir isso depois do produto pronto sai caro.

5. Fixe a versão do modelo em produção. Aponte para uma revisão específica dos pesos, guarde o hash e documente. A liberdade de congelar o comportamento é uma das maiores vantagens dos pesos abertos, e ela se perde se você usa uma tag que se move. Com laboratórios soltando atualização a cada poucas semanas, isso ficou ainda mais relevante.

6. Trate quantização também como decisão de qualidade. Rode o seu conjunto de avaliação em duas quantizações diferentes antes de decidir. Em algumas tarefas a queda é invisível; em outras, especialmente as que exigem precisão numérica, ela aparece na hora.

7. Cheque a residência do dado antes de usar API oficial. Se o dado é de cliente, verifique onde ele é processado e o que o contrato do provedor diz sobre retenção. Rodar os mesmos pesos em provedor ocidental ou na sua nuvem resolve o problema sem trocar de modelo.

8. Combine aberto e fechado com um roteador simples. Uma regra de duas linhas que manda tarefa curta para o modelo barato e tarefa complexa para o modelo de fronteira derruba a fatura sem derrubar resultado. Vale para pipelines de conteúdo, de atendimento e de dados.

9. Ajuste prompt e contexto antes de treinar pesos. Fine-tuning resolve comportamento e formato, e fica como última parada da fila. Quem começa por ele quase sempre está gastando GPU para consertar um prompt preguiçoso.

10. Instrumente custo por tarefa. Registre tokens de entrada e saída por chamada e agregue por tipo de tarefa. O total do mês esconde o problema, e a visão por tarefa mostra que aquele único endpoint esquecido está consumindo metade do orçamento de IA da empresa.

Depois de rodar isso em produção por um bom tempo, a pergunta que nós fazemos para cada tarefa é qual nível de qualidade e qual nível de custo aquela camada do produto tolera. Trabalho de engenharia difícil, agente que precisa navegar um repositório inteiro e tarefa onde o erro sai caro continuam com o melhor modelo fechado disponível. Tudo que é volume, repetição, triagem e primeira versão vai para a IA open source, e o dinheiro que sobra dessa troca costuma financiar o resto da operação.

Para quem está montando esse arranjo agora, o passo inicial é modesto e rende: escolha uma tarefa repetitiva do seu pipeline, meça quanto ela custa hoje, rode a mesma tarefa em dois modelos abertos via provedor e compare acerto, latência e preço em cima de casos reais. Em uma tarde você tem número em vez de opinião, e número é o que sustenta a decisão na próxima reunião de custo. Se o seu time também está construindo produto com ferramentas de IA, vale entender o que é vibe coding antes de decidir onde cada modelo entra no fluxo.


Leia também:

▸ THE_DOWNLOAD.SUBSCRIBE

Carregue a semana.
Instale na segunda.

Um digest do blog da Marfin. Todo sábado.

Grátis. Eject quando quiser.

A Marfin é uma venture builder de empresas tech.

Quer conhecer nossos serviços e produtos?