JustVugg/colibri
Motor de inferência em C puro que roda modelos MoE gigantes (do GLM-5.2 de 744B ao Kimi K3 de 2,8T) em máquina comum, carregando do disco só os 'especialistas' que cada token precisa. Viralizou porque provou algo que parecia impossível: um modelo de fronteira rodando com ~25 GB de RAM, sem GPU obrigatória, 22 mil estrelas em um mês.
O que é, em uma frase honesta
Colibrì é um motor de inferência minúsculo, escrito em C puro e sem dependências, que roda modelos de linguagem gigantes do tipo MoE (mistura de especialistas) em hardware que você já tem. O truque: um modelo como o GLM-5.2 tem 744 bilhões de parâmetros, mas cada token só ativa uns 40 bilhões, e desses, só ~11 GB mudam de um token pro outro. Em vez de exigir que tudo caiba na memória, o Colibrì trata disco, RAM e placa de vídeo como uma hierarquia única: os pesos que todo mundo usa ficam na memória (~10 GB) e os especialistas ficam no SSD, carregados na hora exata em que o roteador do modelo prova que precisa deles.
O autor chama de 'um JIT para pesos'. Compila com gcc, sem CUDA, sem Docker, sem Python.
Para que serve na prática
Serve para ter um modelo de fronteira inteiro na sua máquina, pesos abertos, sob seu controle, sem alugar datacenter. Casos concretos: rodar o GLM-5.2 (744B) num desktop com 25-32 GB de RAM e um SSD NVMe com os 372 GB do modelo; usar a mesma engine para quatro famílias de modelos (GLM-5.2, Inkling 975B, Kimi K3 2,8T e OLMoE 7B) com o mesmo comando de chat, API e painel web; estudar como o modelo pensa, com um 'atlas de especialistas' que mostra os 19 mil experts acendendo em tempo real. A ressalva honesta: é lento.
Na máquina modesta do autor, 0,05-0,1 token por segundo; com 6 GPUs de ponta, ~6 tok/s; num Mac M5 Max, ~1 tok/s. É ferramenta de posse e pesquisa, não de atendimento em produção.
Quando faz sentido pra você que lidera
Faz sentido como prova de conceito de soberania: se seus dados não podem sair de casa (jurídico, saúde, financeiro), o Colibrì demonstra que dá para ter um modelo de nível fronteira rodando em máquina própria, com custo de hardware de escritório, não de datacenter. Também é uma peça de negociação: quando o fornecedor de API sobe o preço, saber que existe alternativa local muda a conversa. O que ele NÃO é: solução de produção para atender clientes em volume, a velocidade de 1 token por segundo serve para tarefas assíncronas (analisar um contrato de madrugada), não para chat ao vivo.
E é projeto de uma pessoa, com um mês de vida: trate como laboratório avançado, não como infraestrutura contratável.
Por que está no mapa
Crescimento raro: criado em 1º de julho de 2026, chegou a 22 mil estrelas em um mês, praticamente 700 estrelas por dia. O estopim foi o lançamento público em 10 de julho, que fez 453 pontos no Hacker News em horas com a manchete improvável 'modelo de 744B em 25 GB de RAM'. A comunidade abraçou rápido: medições em Mac M5 Max e Framework 13, modelo já convertido no Hugging Face e suporte estendido ao Kimi K3 de 2,8 trilhões de parâmetros.
Desenvolvimento segue ativo (mais de mil commits, último push em 1º de agosto), tocado pelo autor Vincenzo Fornaro.
Valeu pelo feedback. Isso ajuda a afiar a biblioteca.