Pensava que tinha comprado uma subscrição. Comprou um contador.
O ChatGPT, o Claude e o Copilot faturam hoje todos por utilização: o seu lugar traz uma quantidade incluída e, acima dela, corre um contador. Nesta página explicamos como funciona essa faturação, porque apanha as pessoas desprevenidas e o que fazer.
O que são créditos de utilização nas subscrições de IA?
Os créditos de utilização são um saldo que compra por cima da sua subscrição de IA. O lugar inclui uma quantidade fixa de utilização; quando acaba, ou o trabalho para, ou continua a partir de um fundo de créditos faturado em separado. O ChatGPT, o Claude e o Microsoft Copilot funcionam hoje todos assim. Um valor mensal fixo tornou-se discretamente um custo variável.
- Um lugar inclui utilização; acima dela corre um contador
- Cada fornecedor tem a sua unidade, não comparável
- Os limites acabam a meio da semana, não na data da fatura
- Uma definição de administrador torna variável um custo fixo
Da subscrição ao contador — e quase ninguém viu isto a chegar
As subscrições de IA começaram por ser algo familiar: um valor por utilizador por mês, como qualquer outro pacote de software. Sabia quanto custava, sabia o que recebia. Esse tempo acabou, e a transição foi tão gradual que a maioria das organizações não deu por ela.
O que veio a seguir é um híbrido: continua a pagar por utilizador, mas esse lugar inclui uma quantidade de utilização. Acima dela começa a correr um contador — créditos no ChatGPT e no Copilot, créditos de utilização no Claude — faturado em separado. A subscrição deixou de ser um teto e passou a ser um piso.
Enquanto as pessoas usam a IA como janela de conversa, quase não se nota. A quantidade incluída chega bem para fazer perguntas e escrever textos. A coisa vira no momento em que alguém corre investigação aprofundada, dá uma tarefa a um agente ou manda processar uma pilha de ficheiros — aí sai um múltiplo por cada ação, e é exatamente essa a utilização que a organização quer.
É daí que vem a surpresa: a fatura sobe por causa precisamente das pessoas que melhor lidam com a IA. Não é razão para as travar. É razão para garantir que sabem o que estão a mexer.
Como funciona a faturação
Três grandes fornecedores, o mesmo princípio, três concretizações diferentes. Os detalhes mudam com regularidade — a mecânica por baixo não.
ChatGPT
Um limite incluído e depois um fundo de créditos partilhado
- Cada lugar traz uma quantidade de utilização incluída.
- Acima disso, recorre a um fundo de créditos da área de trabalho que o administrador compra à cabeça.
- As funcionalidades pesadas — investigação aprofundada, modelos de raciocínio, geração de imagem, voz, agentes de código — saem todas desse mesmo fundo.
- Os créditos comprados têm uma validade de doze meses.
Claude
Limites que reiniciam num momento fixo da semana
- Os lugares trazem utilização incluída com um limite semanal.
- Esse limite reinicia num momento fixo atribuído à sua conta — não no primeiro dia do mês.
- Ao atingir o limite pode esperar pelo reinício, passar a um plano mais forte, ou o administrador ativa créditos de utilização.
- Com esses ativos, o trabalho continua e a utilização extra é faturada em separado.
Microsoft Copilot
Créditos, pagos à cabeça ou no fim
- Os agentes e o Copilot Studio faturam em créditos — até setembro de 2025 chamavam-se 'messages'.
- Ou compra pacotes de capacidade pré-pagos, ou acerta contas depois através do Azure.
- Ações diferentes consomem números diferentes de créditos.
- Quem já tem uma licença Microsoft 365 Copilot fica em parte coberto por ela.
Três fornecedores, três unidades, nenhuma leitura de contador comum. Quem está em dois dos três tem duas formas diferentes de contar — e nem um único ecrã que as some.
Porque é que isto apanha as pessoas desprevenidas
Não por estar escondido — está nas condições. Mas porque se comporta de forma diferente de todo o software que comprou antes disto.
01
A unidade é inventada — e não é comparável
Um crédito não é um token nem uma message nem um premium request. Cada fornecedor inventa a sua unidade, define o câmbio e altera-o: a Microsoft mudou 'messages' para 'créditos'. Não dá, portanto, para pôr duas propostas lado a lado pela unidade — só pelo que consegue mesmo fazer com ela.
02
Nem todas as ações custam o mesmo
Fazer uma pergunta curta e lançar uma investigação aprofundada são quase idênticos na mesma interface. Em consumo diferem numa ordem de grandeza. Nada no ecrã diz ao utilizador qual das duas acabou de fazer.
03
O limite cai a meio do trabalho
Não na data da fatura, mas na quinta-feira à tarde a quem tem de entregar o relatório. É por isso que isto chega como surpresa: não é um problema de contabilidade que aterra na financeira, é uma interrupção de trabalho em alguém com um prazo.
04
Os saldos podem caducar
Os créditos pré-pagos têm prazo de validade. Comprar com folga para se ver livre da chatice não é, portanto, uma escolha gratuita — a mais é dinheiro deitado fora tal como a menos é uma interrupção de trabalho.
05
Uma opção transforma o fixo em variável
Um administrador ativa o 'continuar depois do limite' para ajudar um colega que ficou preso. A partir daí a subscrição deixa de ser um teto e passa a ser um piso, e o resto do ano a pergunta já não é 'quanto custa' mas 'quanto é que deu'.
Porque é que o consumo sobe tão depressa
Por baixo de cada crédito está a mesma unidade: tokens, os pedaços de texto em que um modelo conta. Quatro coisas explicam porque passam tantos.
O contexto segue junto em cada passo
Um modelo não guarda nada entre duas chamadas. Todas as instruções, ficheiros recolhidos e respostas anteriores seguem outra vez de cada vez. Resolver uma tarefa em vinte passos significa pagar esse contexto vinte vezes.
Os agentes dão dezenas de passos por tarefa
Planear, procurar, consultar um sistema, verificar, corrigir. Os analistas medem que as tarefas com agentes consomem um múltiplo de uma única pergunta de conversa — e o tamanho desse múltiplo depende do que o modelo decide pelo caminho.
O que sai pesa mais do que o que entra
A saída conta várias vezes mais do que a entrada em praticamente todos os fornecedores. Os modelos que pensam primeiro em voz alta produzem ainda passos intermédios que nunca vê mas que consome.
As tentativas falhadas também contam
Uma chamada repetida, um agente às voltas, um utilizador a reformular três vezes. Nada disso fica registado como erro — desaparece simplesmente no total.
Mais sobre como funcionam os agentes e porque consomem tanto na base de conhecimento em agente de IA e RAG.
O que fazer: literacia, consciência, normalização
A resposta aos custos de consumo raramente é um painel. Está no que as pessoas sabem, no que conseguem ver e em quão assente está a vossa forma de trabalhar.
01
Literacia
As pessoas não conseguem poupar naquilo cuja unidade não percebem.
- Saber o que é um crédito e o que sai do fundo na vossa situação.
- Reconhecer quando se põe um agente a trabalhar em vez de fazer uma pergunta.
- Saber que há um limite, quando reinicia e o que fazer quando se chega lá.
- Perceber que arrastar uma conversa longa custa mais do que começar de novo.
Isto não é um tema financeiro, é uma competência de utilizador. Meio dia de explicação a quem abre a ferramenta todos os dias rende mais do que qualquer painel.
02
Consciência
O consumo que só se vê na fatura foi visto com um mês de atraso.
- Cada aplicação tem um dono que sabe o que ela consome.
- O consumo é visível no momento, e não apenas depois como total.
- Um alerta quando o padrão foge, não só quando se chega ao teto.
- Um balanço mensal curto: o que corremos, o que rendeu.
Quem vê, decide. Na prática o consumo desce logo que as pessoas sabem que alguém está a acompanhar — ainda antes de haver uma única regra combinada.
03
Normalização
O consumo só se torna previsível quando o trabalho por baixo é previsível.
- Uma ferramenta por tarefa, em vez de três assistentes a fazer o mesmo.
- Um modelo por omissão combinado, com uma razão para se desviar dele.
- Formas de trabalhar fixas e instruções partilhadas para o que se repete.
- Aplicação nova? Passa por alguém antes de entrar em produção.
Sem norma, o consumo depende de quem calha pegar na tarefa. Com norma, sabe à partida quanto custa mais ou menos um processo — e um desvio salta logo à vista.
PME ou grande organização: o ganho está noutro sítio
A faturação funciona da mesma maneira, a maior poupança não. Comece onde a sua organização está a deixar mais em cima da mesa.
PME
Arrumar o que já tem
- Licenças que paga para pessoas que quase não abrem a ferramenta.
- Três assistentes lado a lado a fazer em grande parte o mesmo trabalho.
- Automatizações a consumir em segundo plano sem dono.
- Alguém a acompanhar o consumo, em vez de ninguém.
Normalmente uma questão de sessões, não de meses. O ganho está na visão de conjunto: saber o que contrata, quem usa e o que rende.
Grande organização
Gerir aquilo que está disperso
- Atribuir o consumo a equipas e aplicações em vez de a uma rubrica única.
- Tetos e alertas no software, e não apenas na política.
- Uma verificação de custo antes de uma nova aplicação entrar em produção.
- Acordos sobre qual é o modelo por omissão e quando se escala.
Aqui o problema não é a intervenção isolada, mas o facto de ninguém ver o conjunto. O controlo surge assim que cada equipa vê o seu próprio consumo e responde por ele.
Como abordamos isto
Não é uma operação de limpeza, são quatro passos que tornam o consumo visível e o mantêm assim.
-
Inventariar o que contrata
primeiro passoQue subscrições estão a correr, que créditos foram comprados, quem usa o quê e o que está em recarga automática. Em quase todas as organizações só este passo já traz surpresas.
-
Combinar regras que se aguentem
prazo curtoQue ferramenta para que tarefa, qual o modelo por omissão, quando se escala e o que passa por alguém antes de ir para produção. Curto e concreto, não um documento de política.
-
Levar as pessoas no trabalho delas
por equipaExplicar o que consome e como obter o mesmo resultado de forma mais leve, a partir das tarefas que fazem mesmo. Não é formação genérica de IA, é o trabalho delas.
-
Manter à vista
contínuoUm dono por aplicação, tetos onde for possível e um balanço mensal curto. Assim o controlo passa a ser um hábito e não uma arrumação pontual.
Sabe o que está a contratar neste momento?
O AI Readiness Scan mapeia que ferramentas e aplicações estão a correr, quem as usa e onde lhe falta controlo. Um ponto de partida concreto para a conversa sobre custos.
Faça o AI Readiness ScanO que rende uma solução de IA bem construída
Todos os projetos →Perguntas frequentes sobre créditos de utilização
O que são exatamente créditos de utilização?
Os créditos de utilização são um saldo que compra por cima da sua subscrição de IA. O seu lugar inclui uma quantidade fixa de utilização; quando essa acaba, ou o trabalho para, ou continua a partir de um fundo de créditos faturado em separado. O ChatGPT, o Claude e o Microsoft Copilot funcionam hoje todos segundo esse princípio, cada um com a sua unidade e as suas regras.
Porque chego a um limite se estou a pagar uma subscrição?
Porque a subscrição não cobre utilização ilimitada, mas uma quantidade incluída. Essa diferença passa despercebida durante muito tempo: com utilização normal de conversa raramente lá se chega. No momento em que alguém corre investigação aprofundada, usa agentes ou manda processar documentos grandes, essa quantidade passa a ser a restrição — e dá por isso a meio do trabalho, não na fatura.
Posso comparar fornecedores pelos créditos?
Não diretamente. Um crédito num não é um crédito noutro, e é o fornecedor que decide quanto sai por cada ação e pode alterá-lo. Compare, por isso, não pela unidade mas pelo que consegue fazer no seu próprio trabalho: quanto de um processo típico cabe naquilo que contrata, e quantas vezes bateu no limite nos últimos meses.
O que acontece quando os créditos acabam?
Depende do que estiver configurado. Se não estiver nada ativo, a utilização para até o limite reiniciar ou até o administrador comprar mais saldo. Se estiver ativo continuar depois do limite, o trabalho segue e a utilização extra é faturada em separado. A primeira variante dá-lhe um teto com interrupções de trabalho, a segunda não dá interrupções mas também não dá teto.
Então devemos ativar essa opção de continuar ou não?
Normalmente sim, mas não sem regras a acompanhar. Pessoas presas a meio do trabalho custam mais do que o consumo que poupa. Ative, mas com um dono a acompanhar, um teto onde for possível e o acordo de que o consumo fora do padrão é conversado. Ativar e esquecer é a variante de onde vem a surpresa.
Porque sobe a nossa fatura de IA se as tarifas por token descem?
Porque o consumo cresce mais depressa do que o preço desce. As aplicações melhoram ao enviar mais contexto: instruções mais longas, ficheiros recolhidos, histórico da conversa, passos intermédios. Cada melhoria custa consumo. A unidade mais barata só se sente quando também gere o número de unidades que usa.
Isto também é relevante para uma PME?
Sim, mas a atenção vai para outro sítio. Em organizações mais pequenas o dinheiro está normalmente em licenças que ninguém usa, em três assistentes lado a lado a fazer em grande parte o mesmo, e em automatizações que consomem em segundo plano sem que alguém esteja a acompanhar. Isso costuma resolver-se em algumas sessões, enquanto as organizações maiores enfrentam antes um consumo espalhado por muitas equipas.
Como evito que daqui a seis meses volte a descontrolar-se?
Não tratando isto como uma arrumação pontual. Um dono por aplicação, um balanço mensal curto e o acordo de que uma aplicação nova passa primeiro por alguém. Junte a isso explicação a quem usa as ferramentas todos os dias; são eles que tomam cem pequenas decisões por semana que, somadas, determinam a sua fatura.
A sua fatura de IA está a subir mais depressa do que esperava?
Marque uma conversa sem compromisso. Olhamos para o que contrata, de onde vem o consumo e que acordos têm efeito mais rápido na sua situação.


