Laya toma decisões em texto em 33 milissegundos com código aberto
Criado por Nandha Kishor, o motor roda classificação direta sem decodificação autoregressiva em mais de cem línguas.
Criado por Nandha Kishor, o motor roda classificação direta sem decodificação autoregressiva em mais de cem línguas.
Engenheiros que colocam modelos generativos para classificar texto gastam tempo de GPU e pagam caro por cada decisão binária. O desenvolvedor Nandha Kishor lançou o Laya em 18 de setembro de 2026 para resolver esse gargalo. O projeto entrega um motor de decisão não autoregressivo que executa escolhas tipadas, pontuações e respostas de sim ou não em 33 milissegundos. Ele atende equipes de infraestrutura que precisam triar milhares de mensagens por segundo sem acionar um modelo generativo pesado.
Em vez de gerar palavras uma a uma, o Laya processa toda a entrada em uma única passagem para a frente. O sistema utiliza a arquitetura ModernBERT e treina os pesos com aprendizado por reforço calibrado contra regras de pontuação estritamente próprias, técnica chamada RLCD. Um componente chamado Router analisa o script e o idioma do texto recebido para despachar a requisição ao modelo correto. Entradas em inglês vão para a base local padrão, enquanto textos em outros idiomas seguem para o laya-multilingual, que cobre mais de 100 línguas. Tudo roda de forma local com PyTorch em CPU ou GPU, sem depender de chamadas para APIs externas. A velocidade impressiona na prática.
O caminho de adoção começa com o interpretador Python 3.10 ou superior no ambiente local. Quem instala a biblioteca principal pelo terminal executa python -m pip install laya e já consegue acionar comandos diretos pelo console. Para fluxos específicos, a ferramenta oferece pacotes extras como laya[serve] para servidor HTTP, laya[mcp] para servidores MCP, laya[langchain] para orquestração com LangChain e LangGraph, além de laya[onnx] e laya[fast] para aceleração em GPU via TileLang. Uma chamada de linha de comando como laya "My payment failed twice" --preset triage responde imediatamente a uma triagem de suporte. A configuração aceita o parâmetro max_len=8192 quando o usuário envia arquivos longos. Sem essa flag, o limite padrão trava a leitura em 1.024 tokens.
Com apenas sete dias de existência, o repositório no GitHub já acumula 24.498 estrelas e 2.106 forks. Esse crescimento repentino exige cautela redobrada de quem planeja colocar o componente em produção crítica. O autor mantém o projeto ativo, registrou o último commit em 25 de setembro de 2026 e liberou a versão v0.3.20 no dia anterior. Ainda assim, 144 issues abertas continuam sem resolução no rastreador oficial. O volume de chamados expõe arestas em ajuste.
O software adota a licença Apache-2.0, o que garante liberdade para uso corporativo, modificação do código e distribuição comercial sem royalties. O Laya, contudo, não serve para quem busca redação criativa, tradução fluida de documentos ou respostas conversacionais extensas. Ele também falha com frequência quando o usuário exige precisão rígida em textos com mais de 4.000 tokens. Em testes de contexto longo, a taxa de acerto caiu para marcas entre 8 e 17 acertos a cada 20 requisições após esse ponto. Se a demanda exige diálogo livre ou análise de relatórios gigantescos, a ferramenta deixa a desejar.