Modelos e LLMs

Simon Willison lança plugin 0.1a0 para servidor local de chat

Pacote expõe modelos instalados em endpoint compatível com a API da OpenAI.

Simon Willison lançou em 30 de julho de 2026 o plugin llm-chat-completions-server 0.1a0. O pacote cria em localhost um endpoint compatível com a API OpenAI Chat Completions. Ele expõe os modelos disponíveis no LLM e nos plugins instalados pelo usuário. O registro usa hashes para deduplicar partes repetidas das mensagens.

Plugin leva modelos locais ao formato da OpenAI

O servidor responde em /v1/chat/completions, caminho usado no exemplo publicado por Simon Willison. A requisição envia um JSON com o modelo qwen3.5-4b e uma lista de mensagens. A lista contém os papéis user e assistant, além das perguntas e respostas da conversa.

O exemplo pergunta “Capital of France?” ao modelo. A resposta registrada é “Paris.” A terceira mensagem pergunta “Germany?” depois da resposta do assistente. O formato permite estender a mesma conversa a cada nova requisição.

O cliente mantém o estado da conversa no modelo apresentado por Willison. Por isso, cada pedido seguinte inclui mais mensagens que o pedido anterior. A primeira chamada contém a pergunta inicial; a segunda acrescenta a resposta do assistente; a terceira inclui a pergunta sobre a Alemanha.

O pacote atende quem precisa chamar modelos do LLM usando o formato da API da OpenAI. O anúncio não diz que o plugin oferece uma conta OpenAI ou acesso aos modelos da OpenAI. Ele apenas descreve compatibilidade com o formato OpenAI Chat Completions.

Os logs endereçáveis por conteúdo do LLM 0.32rc1 sustentam a nova lógica. O esquema identifica cada parte da mensagem com um hash. Quando uma conversa repete partes já registradas, o LLM pode usar esses hashes para evitar duplicação no log.

Willison apresenta a deduplicação como objetivo do desenho. O anúncio não informa quanto espaço, tempo ou processamento a técnica economiza. Também não traz benchmark para comparar o plugin 0.1a0 com outra implementação.

Instalação usa versão prévia e porta 9001

O teste começa com uv tool install llm --pre. O parâmetro --pre instala uma versão prévia do LLM, conforme o comando publicado. Depois, o usuário executa llm install llm-chat-completions-server para instalar o plugin 0.1a0.

O comando llm chat-completions-server -p 9001 inicia o servidor. A opção -p 9001 define a porta 9001. O anúncio informa que o serviço fica disponível em localhost, não em um endereço público descrito na publicação.

A coleção exposta depende dos plugins que o usuário instalou no LLM. O servidor não apresenta uma lista própria de modelos no anúncio. O pacote reúne os modelos disponíveis na instalação local e os entrega pelo endpoint compatível.

A publicação não informa sistema operacional, requisito de hardware ou mecanismo de autenticação. Ela também não descreve acesso remoto, controle de usuários ou implantação em produção. Esses recursos não aparecem como parte da versão 0.1a0 anunciada por Simon Willison.

O texto identifica GPT-5.6 Sol como responsável por escrever todo o código. Willison afirma que o modelo conhece bem o formato da API OpenAI Chat Completions. A publicação não fornece revisão externa, testes independentes ou métricas para verificar essa afirmação.

O plugin nasce junto do LLM 0.32rc1 e de seus logs endereçáveis por conteúdo. A página de Willison também lista, em 4 de agosto de 2026, uma versão do LLM com traces de raciocínio, OpenAI Responses, ferramentas no servidor e logs mais inteligentes. O anúncio de 30 de julho não afirma que esses recursos posteriores façam parte do llm-chat-completions-server 0.1a0.

Fontes

Simon WillisonModelos e LLMs
Como fazemos: nossa equipe monitora diariamente os repositórios de código aberto em maior alta e produz esta cobertura com apoio de modelos de linguagem, sempre a partir de dados verificados na fonte primária — repositório, documentação oficial e ranking público. Os números de estrelas e a posição no ranking refletem o momento da coleta. Entenda o método.