Fastino Labs lança GLiNER2.5-Decide, modelo open-weight de 340M parâmetros para decisões estruturadas em pipelines de IA
A Fastino Labs anunciou o lançamento do GLiNER2.5-Decide, um modelo de decisão de pesos abertos com 340 milhões de parâmetros voltado para aplicações de inteligência artificial. O modelo recebe um texto e um esquema de perguntas tipadas e devolve respostas estruturadas, acompanhadas de distribuição de probabilidade, pontuação de confiança e metadados de viabilidade de restrições. O lançamento aconteceu em 24 de setembro de 2026 e tem como foco principal as decisões operacionais frequentes dentro de pipelines de agentes, como roteamento, triagem, seleção de ferramentas e guardrails, que são mecanismos automáticos para garantir que um sistema de IA siga regras de segurança.
Diferentemente de modelos generativos, o GLiNER2.5-Decide funciona como um classificador não generativo. Ele utiliza um codificador DeBERTa-v3-large, um tipo de arquitetura de rede neural especializada em compreender representações internas do texto, e foi ajustado a partir do modelo gliner2-large-v1. O sistema não gera tokens, que são as unidades básicas de texto processadas por modelos de linguagem, nem depende de templates de prompt. Os conjuntos de rótulos são informados no momento da chamada, o que permite adaptar o modelo a diferentes cenários sem necessidade de retreinamento.
Cada pergunta dentro do esquema declara quais respostas são permitidas e se espera uma única resposta, múltiplas respostas ou um valor ordenado. Os esquemas podem incluir instruções, exemplos, descrições de rótulos e regras que conectam respostas entre diferentes perguntas. O processo interno acontece em duas etapas. Primeiro, o codificador lê o texto e o esquema de forma conjunta, atribuindo pontuações a cada resposta permitida. Em seguida, um decodificador com restrições busca a melhor atribuição combinada possível, respeitando as regras declaradas no esquema. A própria equipe da Fastino destaca o escopo limitado da ferramenta: o modelo não raciocina, não explica e não responde perguntas abertas, sendo um especialista em decisões operacionais.
A importância da decodificação conjunta fica clara em um exemplo de guardrail apresentado pela equipe. Quando processado de forma independente, o modelo identificou uma tentativa de injeção de prompt com pontuação 0,82, mas também classificou o mesmo texto como seguro com 0,52. Havia um conflito nas saídas. Com a decodificação conjunta, aplica-se uma regra que determina que qualquer dano detectado exige um veredito de insegurança. Assim, o modelo retorna de forma combinada segurança igual a inseguro e tipo de dano igual a injeção de prompt, permitindo que sistemas downstream bloqueiem, direcionem ou escalem o caso corretamente.
Os esquemas podem expressar implicações, exclusões, limites de cardinalidade e restrições ordinais. O mesmo codificador também consegue extrair entidades, relações e registros estruturados com deslocamentos em nível de caractere em uma única passagem. A avaliação foi realizada na suíte interna chamada Fast Decisions, com 5.100 exemplos de teste divididos em 17 conjuntos de dados. As tarefas abrangem operações com clientes, roteamento por domínio, como bancos, clínica, viagens e benefícios, além de compreensão geral de conteúdo. O modelo GLiNER2.5-Decide obteve média de 60,1% de acerto exato e liderou em nove dos 17 conjuntos, com destaque para intenção de suporte, onde atingiu 75,3%, e intenção bancária, com 64,3%.
Em testes de latência com lote unitário e esquema de duas cabeças e 15 rótulos, o modelo apresentou, em entradas curtas de 64 tokens, tempos medianos de 167,3 milissegundos em CPU Intel Xeon Platinum, 43,6 milissegundos em GPU NVIDIA T4, 43,4 milissegundos em NVIDIA L4, 38,3 milissegundos em NVIDIA V100 e 47,3 milissegundos em NVIDIA A100. Em entradas maiores, de 1.024 tokens, a A100 alcançou 52,6 milissegundos, contra 75,6 milissegundos na V100 e 131,4 milissegundos na L4. Os pesos do modelo são distribuídos sob a licença Apache 2.0 e podem ser instalados via pip install gliner2, funcionando em CPU, GPU ou em ambientes isolados da rede externa.
A Fastino também oferece inferência hospedada e ajuste fino por meio da API GLiNER, com suporte para LoRA, técnica que permite ajustar grandes modelos treinando apenas uma pequena parte dos parâmetros, de forma local ou remota. O ajuste é feito pelo treinador GLiNER2, e um arquivo SKILL.md expõe o fluxo hospedado a agentes de codificação. Além da versão de 340M, foram publicados o GLiNER2.5-Decide-1B, baseado no codificador Ettin 1B e com 59,6% na mesma suíte, e o GLiNER2.5-multi-Decide, modelo multilíngue de 287 milhões de parâmetros que obteve 56,7%. Entre os casos de uso indicados estão roteamento de modelos, chamada de ferramentas, uso de navegador e computador, guardrails, poda de contexto, LLM-as-a-judge, técnica em que um modelo de linguagem avalia a saída de outro, e simulações.