A black router with antennas on a wooden desk
IA

Ramp lança Router, API de LLM gratuita nos EUA até 2026

O serviço roteia solicitações entre vários provedores de modelo e tem como padrão a retenção de dados por um ano, com opção de exclusão.

Por Elliot Marsh6 min de leitura

A Ramp lançou o Router, uma API que permite que as empresas direcionem solicitações de IA entre vários provedores de modelos de linguagem grandes com estratégias de roteamento integradas e um painel de gastos e latência. O serviço é exclusivo para os EUA no lançamento, gratuito para uso até o final de 2026, excluindo os custos de inferência, e vem com uma política de retenção padrão de um ano, com opção de saída, para prompts e saídas.

Principais Conclusões

  • A Ramp lançou o Router, umaAPIque permite que as equipes alternem entre vários provedores de modelos de linguagem grandes com estratégias de roteamento e um painel de gastos/desempenho.
  • O Router é limitado a usuários dos EUA no lançamento e é gratuito para uso até o final de 2026, excluindo os custos de inferência do modelo subjacente, com um crédito de lançamento de $26.
  • A Ramp afirma que o roteador está em funcionamento internamente há três anos, posicionando o lançamento como uma ferramenta de produção externalizada em vez de um novo experimento.
  • A política padrão retém entradas, saídas e chamadas de ferramentas do modelo por um ano com base na opção de saída, e a Ramp afirma que remove informações pessoalmente identificáveis antes de usar o conteúdo para melhorar o produto.

Ramp Lança Router: Uma API de Roteamento de LLM Exclusiva para os EUA, Gratuita Até 2026

A Ramp, mais conhecida por gerenciamento de despesas corporativas, avançou ainda mais na infraestrutura de IA com o Router, um serviço de roteamento de modelos que fica entre um aplicativo e vários provedores de modelos de linguagem grandes. Mecanicamente, é uma única integração de API que pode enviar cada solicitação para um fornecedor de modelo escolhido com base em regras.

A consequência é menos dependência de fornecedores para equipes que executam fluxos de trabalho pesados em IA, e um caminho mais claro para a Ramp cobrar por "direção de tráfego" em inferência.

O Router está disponível apenas nos Estados Unidos no lançamento. A Ramp também está tornando o serviço gratuito para uso pelo restante de 2026, enquanto ainda exige que os clientes paguem os custos de inferência do modelo subjacente. Um crédito de lançamento de $26 está incluído, e a Ramp não divulgou qual será o custo do Router em 2027.

A Ramp está apresentando o Router como uma produtização externa de ferramentas internas, dizendo que usou seu router para suas próprias necessidades de uso de IA nos últimos três anos. Isso é importante porque as camadas de roteamento tendem a falhar de maneiras entediantes primeiro, como picos de latência em casos extremos, interrupções de provedores e discrepâncias de cobrança. "Já vivemos isso em produção" é a proposta de credibilidade.

Como o Router Funciona: Uma Integração Através da OpenAI, Anthropic, DeepSeek, xAI e Mais

Um roteador de modelo é um policial de tráfego para inferência de IA, não um novo modelo. Os desenvolvedores integram uma vez e, em seguida, escolhem qual provedor lida com cada solicitação sem reescrever seu aplicativo para a API de cada fornecedor. A proposta do Router é que os custos de mudança passam de "projeto de engenharia" para "mudança de configuração", o que torna a opcionalidade do fornecedor real.

No lançamento, o Router fornece acesso a modelos da OpenAI, Anthropic, DeepSeek, Moonshot, Minimax, Nvidia, xAI e Z.ai. A Ramp ainda não está tentando vencer pela amplitude do catálogo. O produto é posicionado como semelhante ao OpenRouter, mas com menos opções de modelos do que a linha do OpenRouter.

O Router também vem com "estratégias" de roteamento, que são regras pré-definidas para onde as solicitações vão. Uma estratégia permite que os usuários definam uma preferência para os níveis de uso flexível dos provedores de modelo. Outra permite que o Router escolha qual modelo direcionar as consultas com base em até três benchmarks especificados pelo usuário.

A Ramp também afirma que os clientes podem direcionar apenas problemas difíceis para modelos mais caros ou testar modelos sem mudar manualmente as integrações.

O detalhe restritivo para algumas equipes é o manuseio de dados. O Router tem uma política de retenção de opt-out que registra entradas, saídas e chamadas de ferramentas do modelo por um ano por padrão. A Ramp diz que removerá informações pessoalmente identificáveis antes de usar esse conteúdo para melhorar o produto, mas não detalhou como essa remoção de PII é implementada ou quais controles as empresas têm além de optar por não participar.

Custo, Latência e Alternativas: O Painel de Gastos em que a Ramp Está Apostando

A segunda superfície de produto do Router é a observabilidade: um painel que relata gastos com tokens, custo, latência, tentativas de fallback e outros detalhes. Tokens são a unidade de cobrança para a maioria dos modelos de texto, latência é o tempo de resposta e tentativas de fallback são reintentos ou mudanças de provedor quando a primeira escolha falha ou não pode atender à solicitação. Juntas, é uma visão tanto da conta quanto dos modos de falha.

Esse painel é a ponte de volta para o negócio principal da Ramp. Se uma equipe está roteando entre vários provedores, a parte complicada não é apenas escolher o modelo mais barato. É entender quando "barato" se torna "lento", quando as restrições de capacidade de um provedor acionam fallbacks e quando uma regra de roteamento silenciosamente muda o gasto de um fornecedor para outro.

A Ramp está apostando que a camada de gastos é pegajosa e que, uma vez que uma empresa confia na medição, ela tolerará a Ramp no caminho da solicitação.

A estrutura gratuita até 2026 reforça essa estratégia de adoção. A Ramp não está isentando a fatura de inferência real, que ainda acumula nos provedores de modelo. Ela está isentando sua própria taxa de roteamento por enquanto, reduzindo a fricção para experimentar o Router como um plano de controle enquanto a Ramp aprende o que os clientes otimizam na prática.

O preço é a questão em aberto após 2026—e a Ramp ainda não está dizendo.

A curva futura no Router é principalmente sobre o que a Ramp escolhe cobrar uma vez que o período gratuito termine. A Ramp não disse quanto o serviço custará em 2027, deixando em aberto se a precificação será uma taxa de uso sobre a inferência, uma assinatura, uma taxa por solicitação ou níveis empresariais ligados a controles e relatórios.

A geografia é outro indicativo. O Router é exclusivo para os EUA hoje, e a expansão além dos EUA sinalizaria uma maior prontidão empresarial e ambição de distribuição, especialmente para equipes que precisam de políticas e manuseio de dados consistentes em diferentes regiões.

A postura de dados é a terceira alavanca. Uma política de retenção padrão de um ano, com opção de saída, é um padrão de alta fricção para alguns operadores, mesmo com alegações de remoção de PII. Retenção mais curta, armazenamento opt-in ou controles empresariais mais claros seriam um sinal concreto de que a Ramp está otimizando para cargas de trabalho reguladas e sensíveis à segurança.

Finalmente, a lista de provedores provavelmente mudará. O Router atualmente suporta OpenAI, Anthropic, DeepSeek, Moonshot, Minimax, Nvidia, xAI e Z.ai. Adições além desse conjunto esclareceriam se a Ramp está construindo um gateway amplo ou um conjunto curado de relacionamentos com laboratórios e provedores de inferência específicos.

Minha leitura: a Ramp está tentando dominar a ‘camada de gastos’ de IA além dos cartões corporativos.

O mecanismo aqui é simples: colocar um plano de medição e controle à frente da inferência, e então tornar a troca barata o suficiente para que as equipes parem de tratar a escolha do modelo como uma porta de mão única. O acesso gratuito ao Router até 2026 faz isso, porque o único custo imediato é a fatura de inferência subjacente, e o painel torna as trocas legíveis em tokens, latência e alternativas.

O limiar que importa é se a Ramp pode transformar esse plano de controle em um padrão empresarial sem ser bloqueada por sua própria postura de retenção. Se o produto mantiver seu registro de um ano, com opção de saída, enquanto tenta se posicionar no meio de prompts sensíveis e chamadas de ferramentas, a adoção tenderá a se inclinar para cargas de trabalho de menor sensibilidade e experimentação.

Se a Ramp apertar os controles de retenção e estabelecer um modelo de precificação credível para 2027, o Router começará a parecer uma camada de pedágio durável para inferência, em vez de um recurso promocional anexado à gestão de gastos.

Fontes