Unsloth publica Qwen3.6-27B-MTP-GGUF — inferência 2.5x mais rápida com Multi-Token Prediction
Unsloth disponibiliza no HF a versão GGUF imatrix do Qwen3.6-27B com Multi-Token Prediction (MTP) embarcado — gera múltiplos tokens por step, resultando em ~2.5x mais throughput na inferência. Em 3 dias acumulou 25.9K downloads e 102 likes. Caso a comunidade r/LocalLLaMA já confirma viabilidade para agentic coding local com 262K de contexto em ~48GB de VRAM. Marca ponto em que modelo open chinês + tooling open-source (unsloth/llama.cpp) oferece alternativa séria a Claude Code/Codex em hardware acessível.
Modelos · huggingface · qwen, unsloth, gguf, mtp, local-llm, agentic-coding