
A OpenAI acaba de apresentar o Ultrafast, um novo nível de serviço para sua API que promete acabar com um dos maiores dilemas da inteligência artificial atual: escolher entre um modelo inteligente ou um modelo rápido. Com a novidade, o GPT-5.6 Sol, modelo mais avançado da empresa, passa a rodar a até 750 tokens por segundo, o que representa uma velocidade até 14 vezes maior que o modo padrão.
Como funciona o Ultrafast
O segredo por trás do salto de desempenho está na parceria da OpenAI com a Cerebras, fabricante de chips especializada em processadores gigantes conhecidos como Wafer-Scale Engine. Diferente das GPUs tradicionais usadas por boa parte da indústria de IA, esses chips são construídos a partir de um wafer de silício quase inteiro, o que elimina gargalos de largura de banda de memória e permite gerar respostas em uma velocidade muito maior.
É importante destacar que o Ultrafast não é uma versão reduzida ou destilada do GPT-5.6 Sol. Trata-se do mesmo modelo completo, rodando sobre uma infraestrutura de hardware diferente — ou seja, a inteligência do sistema permanece a mesma, apenas a velocidade de resposta muda.

Benchmarks e limitações
Segundo testes divulgados pela própria Cerebras, o GPT-5.6 Sol no modo Ultrafast concluiu as 2.500 questões do Humanity’s Last Exam, benchmark de nível de doutorado, em 11 horas e 11 minutos. Para efeito de comparação, a empresa afirma que o Claude Fable 5 levou quase 78 horas para completar avaliação semelhante. Vale ressaltar que esses números são medições feitas pela própria Cerebras, e não avaliações independentes.
Na prática, a diferença de velocidade é sentida principalmente em tarefas como programação, geração de documentos extensos e aplicações que dependem de resposta em tempo real. De acordo com a OpenAI, um trecho de código de cerca de 2 mil tokens, que normalmente levaria bem mais tempo, pode ser gerado em pouco menos de 3 segundos na nova camada.
Por enquanto, porém, o acesso ao Ultrafast está restrito. A OpenAI liberou o recurso apenas em prévia limitada, para um grupo seleto de clientes da API, com foco em áreas como programação, atendimento ao cliente, pesquisa financeira e comércio. Não há previsão oficial de preço, e a expansão para mais usuários deve acontecer de forma gradual conforme a capacidade de infraestrutura da parceria com a Cerebras aumenta.

A movimentação reforça a corrida da OpenAI contra concorrentes como Google e Anthropic não apenas em qualidade de resposta, mas também em velocidade — um fator cada vez mais decisivo para empresas que querem integrar IA em produtos que exigem interação em tempo real. Resta acompanhar quando o Ultrafast deixará a fase de testes e se tornará acessível ao público em geral.