<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"><channel><title>El Compilado — llama.cpp</title><description>Cada noticia sobre llama.cpp del briefing diario de El Compilado.</description><link>https://elcompilado.com</link><language>es</language><item><title>Meta lanza Muse Glimmer, modelo agéntico open-weight de 30B que corre en una laptop</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-10/#meta-lanza-muse-glimmer-modelo-agentico-open-weight-de</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-10/#meta-lanza-muse-glimmer-modelo-agentico-open-weight-de</guid><description>Es una destilación de Muse Spark 1.2 bajo licencia Apache 2.0, pensada para agentes locales &quot;always-on&quot;: coding, function calling y razonamiento multi-paso sin depender de la nube. Meta reporta mejoras de velocidad de decodificación de 3,1× en una RTX 5090 y 1,8× en M5 Max; ya está en Hugging Face con soporte para llama.cpp y Ollama. Zuckerberg acompañó el release con una defensa del open source y de la destilación como motor de progreso. Meta AI Research · CNBC · HN (157 comentarios)

Fuentes: https://research.meta.ai/blog/introducing-muse-glimmer-open-agentic-model · https://www.cnbc.com/2026/08/10/meta-muse-glimmer-open-weight-ai.html · https://news.ycombinator.com/item?id=49241679</description><pubDate>Mon, 10 Aug 2026 00:00:00 GMT</pubDate><category>ia</category><category>meta</category><category>huggingface</category><category>llama-cpp</category></item><item><title>Guía práctica: tooling de inferencia local comparado (llama.cpp, Ollama, vLLM, SGLang)</title><link>https://elcompilado.com/blog/briefing-tech-2026-07-30/#guia-practica-tooling-de-inferencia-local-comparado-llama-cpp</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-07-30/#guia-practica-tooling-de-inferencia-local-comparado-llama-cpp</guid><description>Repaso actualizado a julio de cuándo conviene cada motor para servir modelos localmente — referencia útil para decidir stack de serving según throughput vs. simplicidad. DEV Community

Fuentes: https://dev.to/sreeraj-sreenivasan/the-complete-guide-to-local-llm-inference-tools-in-july-2026-llamacpp-ollama-vllm-sglang-and-4mh1</description><pubDate>Thu, 30 Jul 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>vllm</category><category>llama-cpp</category></item><item><title>Correr Kimi K3 localmente: MXFP4 y llama.cpp</title><link>https://elcompilado.com/blog/briefing-tech-2026-07-28/#correr-kimi-k3-localmente-mxfp4-y-llama-cpp</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-07-28/#correr-kimi-k3-localmente-mxfp4-y-llama-cpp</guid><description>Con los pesos abiertos de Kimi K3 ya publicados (~1,4 TB en MXFP4), la comunidad está armando guías para self-hosting. La ruta práctica: GGUF + llama.cpp (sin paso extra de conversión/cuantización, se apunta el server al archivo) o vLLM/SGLang para serving. El Hub de Hugging Face (org ggml-org) concentra las conversiones oficiales. Accionable para quien quiera evaluar un frontier open-weight sin depender de API. explainx · dev.to — guía inference tools

Fuentes: https://explainx.ai/blog/kimi-k3-run-locally-open-weights-desktop-july-2026 · https://dev.to/sreeraj-sreenivasan/the-complete-guide-to-local-llm-inference-tools-in-july-2026-llamacpp-ollama-vllm-sglang-and-4mh1</description><pubDate>Tue, 28 Jul 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>huggingface</category><category>kimi</category><category>vllm</category><category>llama-cpp</category></item><item><title>Hugging Face transformers v5.13.0 se alinea con la última vLLM</title><link>https://elcompilado.com/blog/briefing-tech-2026-07-28/#hugging-face-transformers-v5-13-0-se-alinea-con</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-07-28/#hugging-face-transformers-v5-13-0-se-alinea-con</guid><description>El release trae fixes de generación, attention, cache, cuantización y serving orientados a habilitar transformers con la versión más reciente de vLLM. Útil si servís modelos y venías peleando compatibilidades entre ambas libs. Nota de ecosistema: TGI está en modo mantenimiento y redirige a vLLM, SGLang, llama.cpp y MLX. Releasebot — Hugging Face

Fuentes: https://releasebot.io/updates/huggingface</description><pubDate>Tue, 28 Jul 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>huggingface</category><category>vllm</category><category>llama-cpp</category></item></channel></rss>