<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"><channel><title>El Compilado — Técnicas y repos</title><description>Noticias de técnicas y repos del briefing diario de El Compilado.</description><link>https://elcompilado.com</link><language>es</language><item><title>DeepSeek libera Harness v0.1: &quot;todo es un plugin&quot;, licencia MIT</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-14/#deepseek-libera-harness-v0-1-todo-es-un-plugin</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-14/#deepseek-libera-harness-v0-1-todo-es-un-plugin</guid><description>Lo más accionable del día. DeepSeek abrió en developer preview un harness de agentes completo y ejecutable — no otro anuncio de modelo — construido sobre su meta-framework Cordis. Cada capacidad es un plugin intercambiable: modelos, herramientas, skills, sesiones, sandboxes, storage, loops, scheduling y hasta la UI, todo configurable sin tocar el código fuente. Se levanta con npx @deepseek-ai/dsh web. Es explícitamente una preview con cambios que rompen compatibilidad, así que no para producción todavía, pero si estás armando scaffolding de agentes vale la pena leer cómo separaron las capas. Fue el #2 de Hacker News el 13 de agosto. deepseek.com/harness · GitHub · The New Stack

Fuentes: https://deepseek.com/harness/en/ · https://github.com/deepseek-ai/deepseek-harness · https://thenewstack.io/deepseek-harness-open-source-plugins/</description><pubDate>Fri, 14 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>deepseek</category><category>github</category></item><item><title>El writeup técnico de Cerebras sobre cómo sirven GPT-5.6 Sol a 750 tok/s</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-14/#el-writeup-tecnico-de-cerebras-sobre-como-sirven-gpt</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-14/#el-writeup-tecnico-de-cerebras-sobre-como-sirven-gpt</guid><description>Más allá del anuncio comercial, el post de ingeniería explica la apuesta contraria al consenso: la inferencia en modelos grandes está limitada por ancho de banda de memoria, así que en lugar de optimizar el movimiento de pesos los meten enteros en 44 GB de SRAM por wafer y pipelinean las capas del modelo entre wafers, con los tokens fluyendo sin interrupción. Lectura obligada si estás pensando en serving y en el trade-off latencia/costo/calidad. Cerebras

Fuentes: https://www.cerebras.ai/blog/accelerating-gpt-5-6-sol-ultrafast-with-openai</description><pubDate>Fri, 14 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>cerebras</category><category>gpt</category></item><item><title>ego-lite encabeza GitHub Trending: un navegador para que los agentes reusen tu sesión ya logueada</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-14/#ego-lite-encabeza-github-trending-un-navegador-para-que</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-14/#ego-lite-encabeza-github-trending-un-navegador-para-que</guid><description>Chromium modificado que le da a cada agente su propio &quot;Space&quot; aislado, reutilizando tu estado de login sin pelearte las pestañas — pensado explícitamente para Claude Code y Codex. El detalle interesante para quien optimiza agentes: su Skill oficial destila cada acción exitosa en herramientas y workflows reutilizables, de modo que tareas parecidas después corren hasta 5× más rápido y con menos tokens. Es memoria procedural aplicada a browser automation. MIT, gratis, macOS por ahora (Windows y Linux en roadmap). GitHub

Fuentes: https://github.com/citrolabs/ego-lite</description><pubDate>Fri, 14 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>github</category><category>claude</category><category>claude-code</category><category>windows</category><category>linux</category></item><item><title>Terminal-Bench 2.1 y DeepSWE se consolidaron como la vara real</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-14/#terminal-bench-2-1-y-deepswe-se-consolidaron-como</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-14/#terminal-bench-2-1-y-deepswe-se-consolidaron-como</guid><description>Vale la pena notar el patrón: los tres releases de la semana (Gemini 3.7 Flash, DeepSeek V4 Pro, GPT-5.6 Sol) se comparan entre sí en DeepSWE, FrontierCode y Terminal-Bench 2.1, no en MMLU ni en benchmarks académicos saturados. Terminal-Bench v2 son 89 tareas en entornos de shell reales cubriendo ingeniería de software, ML, seguridad y data science; hoy GPT-5.6 Sol lidera con 89.5% y Claude Opus 5 queda en 89.1%. Si estás evaluando modelos para trabajo agéntico, esa es la tabla a mirar. Leaderboard de agentes de código (agosto 2026)

Fuentes: https://www.morphllm.com/best-ai-coding-agents-2026</description><pubDate>Fri, 14 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>deepseek</category><category>gpt</category><category>claude</category><category>gemini</category></item><item><title>Comparativa práctica: un prompt, 11 modelos, resultados distintos</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-14/#comparativa-practica-un-prompt-11-modelos-resultados-distintos</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-14/#comparativa-practica-un-prompt-11-modelos-resultados-distintos</guid><description>Netlify publicó un experimento simple y honesto sobre cuánto divergen los modelos ante el mismo prompt — útil como recordatorio de que el &quot;mejor modelo&quot; depende de la tarea y de que conviene probar antes de casarse con uno. Estuvo entre lo más leído de Hacker News el 13 de agosto. Discusión en HN (con link al post original)

Fuentes: https://news.ycombinator.com/item?id=49285327</description><pubDate>Fri, 14 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category></item><item><title>Grok 4.6 para agent builders: nuevo nivel xhigh de reasoning_effort y disponibilidad amplia</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-13/#grok-4-6-para-agent-builders-nuevo-nivel-xhigh</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-13/#grok-4-6-para-agent-builders-nuevo-nivel-xhigh</guid><description>El parámetro reasoning_effort ahora soporta low/medium/high/xhigh; el modelo está disponible vía API, Cursor, Grok Build y OpenRouter a US$2/US$6 por millón de tokens (variante rápida al doble). Con 500K de contexto y RL específico en entornos de coding y CAD, es candidato directo para harnesses de agentes de larga duración — vale la pena A/B-testearlo contra tu modelo actual en tareas multi-paso. MarkTechPost · dev.to (benchmarks y pricing)

Fuentes: https://www.marktechpost.com/2026/08/12/spacexai-releases-grok-4-6/ · https://dev.to/jamilxt/grok-46-released-benchmarks-pricing-and-what-it-means-for-agent-builders-28ob</description><pubDate>Thu, 13 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>grok</category></item><item><title>Agent Plugins v1.0.0: el estándar de plugins para agentes ya es implementable</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-13/#agent-plugins-v1-0-0-el-estandar-de-plugins</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-13/#agent-plugins-v1-0-0-el-estandar-de-plugins</guid><description>(working draft publicado el 11/8, con adopción moviéndose en las últimas horas). Especificación con schemas JSON canónicos, guías para autores y clientes, y matriz de compatibilidad que abarca OpenAI, AWS, Cursor, GitHub y VS Code. Si mantenés tooling para agentes, es el momento de revisar el draft y validar tus manifests contra los schemas. explainx.ai - Sin más novedades verificables de las últimas 24h en esta categoría. Contexto de la semana: en GitHub trending siguen dominando los visual builders de agentes (Langflow, Dify, Flowise) y crece la acción Claude Code Security Review de Anthropic para revisar PRs con Claude. OSSInsight · startupcorners (digest 9/8) --- Fuentes agregadoras usadas para ítems sin cobertura primaria accesible: Tech Startups (13/8), que cita Reuters, Bloomberg, WSJ, FT, SecurityWeek y TNW. Ítems no verificables u older de 24h fueron omitidos.

Fuentes: https://explainx.ai/blog/agent-plugins-openai-standard-aws-cursor-github-vscode-2026 · https://ossinsight.io/trending/ai · https://startupcorners.com/digest/devtools-digest-2026-08-09</description><pubDate>Thu, 13 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>openai</category><category>anthropic</category><category>amazon</category><category>github</category><category>claude</category><category>claude-code</category></item><item><title>Correr Muse Glimmer 30B local como motor de agentes</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-12/#correr-muse-glimmer-30b-local-como-motor-de-agentes</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-12/#correr-muse-glimmer-30b-local-como-motor-de-agentes</guid><description>Lo más accionable de las últimas 24h: la colección de Hugging Face trae pesos BF16, GGUF k-quants (de Unsloth, publicados ayer), builds de ExecuTorch y el drafter DFlash para speculative decoding. Con ~20 GB corre en una GPU de consumo o Mac dentro de un loop de agente real, sin llamadas de red. Si querés agentes locales con tool use y 131K de contexto, es el candidato a probar hoy. Fuentes: VentureBeat, explainx.

Fuentes: https://venturebeat.com/technology/meta-returns-to-open-source-with-muse-glimmer-an-apache-2-0-licensed-30b-parameter-ai-model-optimized-for-agents-available-now · https://explainx.ai/blog/meta-muse-glimmer-open-weight-30b-agentic-model-2026</description><pubDate>Wed, 12 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>huggingface</category></item><item><title>NVIDIA publica Nemotron 3.5 Lightning y NeMo Switchyard</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-12/#nvidia-publica-nemotron-3-5-lightning-y-nemo-switchyard</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-12/#nvidia-publica-nemotron-3-5-lightning-y-nemo-switchyard</guid><description>Nemotron 3.5 Lightning es un modelo de alta eficiencia para cargas agénticas; Switchyard es una librería open source de routing inteligente entre modelos dentro de herramientas de agentes populares — útil si querés enrutar tareas baratas a modelos chicos y reservar el modelo grande para lo difícil. Fuente: The Daily Commit (11/8).

Fuentes: https://www.thedailycommit.in/editions/2026-08-11</description><pubDate>Wed, 12 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>nvidia</category></item><item><title>GPT-5.6-Cyber como herramienta práctica para equipos de seguridad</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-12/#gpt-5-6-cyber-como-herramienta-practica-para-equipos</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-12/#gpt-5-6-cyber-como-herramienta-practica-para-equipos</guid><description>Si trabajás en seguridad ofensiva/defensiva autorizada, el acceso vía Daybreak Red habilita flujos que los modelos generales bloquean (validación de exploits, revisión profunda de código, respuesta a incidentes). Requiere verificación como defensor aprobado. Fuente: Releasebot. Nota: no encontré más material verificable de las últimas 24h para esta sección (los digests de GitHub Trending más recientes son del 9/8, fuera de ventana), así que preferí no rellenar.

Fuentes: https://releasebot.io/updates/openai</description><pubDate>Wed, 12 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>github</category><category>gpt</category></item><item><title>antirez publicó h3.c: inferencia nativa de MiniMax H3 en Apple Silicon</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-11/#antirez-publico-h3-c-inferencia-nativa-de-minimax-h3</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-11/#antirez-publico-h3-c-inferencia-nativa-de-minimax-h3</guid><description>Salvatore Sanfilippo (creador de Redis) lanzó una implementación from-scratch en Metal 4 del modelo de generación de video MiniMax H3. En una M5 Max renderiza clips de 512×512 y 22 frames en ~12,6 s (u ~8 s con reuso de velocity 3×), con pico de ~25,9 GiB usando cuantización int8 de activaciones y kernels fusionados. Referencia excelente si te interesa inferencia local optimizada a mano. GitHub

Fuentes: https://github.com/antirez/h3.c</description><pubDate>Tue, 11 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>apple</category><category>github</category></item><item><title>Evo-Bench: el primer benchmark que mide si un LLM puede mejorar su propio harness de agente</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-11/#evo-bench-el-primer-benchmark-que-mide-si-un</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-11/#evo-bench-el-primer-benchmark-que-mide-si-un</guid><description>Aísla la capacidad del modelo de optimizar autónomamente su scaffolding en dominios Search, Office y General. En nueve modelos frontier y open-weight, los mejores logran ganancias absolutas de hasta 16,6 puntos, casi igualando harnesses diseñados por humanos en Search y General — pero se estancan en workflows de Office. Útil si estás construyendo agentes que se auto-mejoran. Paper (HF)

Fuentes: https://huggingface.co/papers/2608.09096</description><pubDate>Tue, 11 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category></item><item><title>SWE-Bench ProMax: nuevo benchmark multilenguaje de refactoring donde el mejor modelo saca 41,2%</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-11/#swe-bench-promax-nuevo-benchmark-multilenguaje-de-refactoring-donde</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-11/#swe-bench-promax-nuevo-benchmark-multilenguaje-de-refactoring-donde</guid><description>Son 170 tareas curadas por expertos en Python, Java, TypeScript, Go, C, C++ y Rust, con un promedio de 11,4 archivos modificados por tarea. Los autores reescribieron cada issue y revisaron los test suites a mano, corrigiendo los tests defectuosos que una auditoría reciente encontró en el 60% de las instancias no resueltas de SWE-Bench Verified. Recalibra qué tan lejos están los agentes de coding del trabajo real. Paper (HF)

Fuentes: https://huggingface.co/papers/2608.09802</description><pubDate>Tue, 11 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category></item><item><title>Dan Luu: el lenguaje de programación casi no predice el costo de un coding agent</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-11/#dan-luu-el-lenguaje-de-programacion-casi-no-predice</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-11/#dan-luu-el-lenguaje-de-programacion-casi-no-predice</guid><description>Desafía el claim viral de que los lenguajes dinámicos dan una gran ventaja de eficiencia de tokens: corriendo los mismos agentes en tareas realistas (decoder de Zstd, Pandoc), la brecha de 2,6× entre C y Clojure reportada en problemas triviales desaparece a mayor dificultad. Lo que sí correlaciona con éxito es la popularidad del lenguaje. Dato útil antes de elegir stack &quot;para agentes&quot;. danluu.com

Fuentes: http://danluu.com/pl-tokens/</description><pubDate>Tue, 11 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category></item><item><title>Metodología para inferir el training run real de modelos frontier</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-11/#metodologia-para-inferir-el-training-run-real-de-modelos</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-11/#metodologia-para-inferir-el-training-run-real-de-modelos</guid><description>Shrivu Shankar publicó una técnica de probing con quizzes de hechos históricos y auto-identificación que revela que los Opus 4.7+ de Anthropic comparten un cutoff de fines de diciembre 2025 (probablemente un mismo run), que la familia GPT-5.6 se agrupa en un checkpoint de febrero 2026, y que Opus 5 tiene un estado de conocimiento más viejo (~enero 2026) que su cutoff publicado de mayo. Interesante para entender qué hay realmente detrás de los model cards. blog.sshh.io

Fuentes: https://blog.sshh.io/p/exploring-claudegpt-knowledge-cutoffs</description><pubDate>Tue, 11 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>anthropic</category><category>gpt</category></item><item><title>Docker Sandboxes: entornos descartables y aislados para agentes de IA</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-10/#docker-sandboxes-entornos-descartables-y-aislados-para-agentes-de</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-10/#docker-sandboxes-entornos-descartables-y-aislados-para-agentes-de</guid><description>(portada de HN hoy, 346 puntos). Docker lanzó un producto para correr agentes con acceso a shell y filesystem dentro de sandboxes efímeros, atacando el problema #1 de los agentes autónomos: ejecutar código generado por el modelo sin exponer tu máquina. Si corrés agentes tipo Claude Code u OpenClaw en local, es una capa de aislamiento lista para usar. Docker · HN (214 comentarios)

Fuentes: https://www.docker.com/products/docker-sandboxes/ · https://news.ycombinator.com/item?id=49239751</description><pubDate>Mon, 10 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>claude</category><category>claude-code</category></item><item><title>semantica: infraestructura graph-native para contexto y auditoría de agentes, #1 en GitHub Trending</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-10/#semantica-infraestructura-graph-native-para-contexto-y-auditoria-de</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-10/#semantica-infraestructura-graph-native-para-contexto-y-auditoria-de</guid><description>(hoy). Se autodefine como &quot;el Palantir open source para agentes&quot;: construye knowledge graphs con provenance W3C PROV-O, registra cada decisión del agente como nodo consultable (record_decision, trace_decision_chain) y razona en forma determinística sin LLM. Incluye MCP server y plugins para Claude Code, Cursor y Windsurf; apunta a dominios regulados donde &quot;¿por qué decidió eso la IA?&quot; tiene que tener respuesta auditable. pip install semantica. GitHub

Fuentes: https://github.com/semantica-agi/semantica</description><pubDate>Mon, 10 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>github</category><category>claude</category><category>claude-code</category><category>mcp</category></item><item><title>Prime Agent (PrimeIntellect): agente RLM auto-mejorable para tareas largas</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-10/#prime-agent-primeintellect-agente-rlm-auto-mejorable-para-tareas</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-10/#prime-agent-primeintellect-agente-rlm-auto-mejorable-para-tareas</guid><description>(trending hoy). Open source (MIT), implementa el modelo Recursive Language Model: el contexto se trata como variables y los subagentes como llamadas a función dentro de un REPL de Python persistente. Lo distintivo es el &quot;Continual Harness&quot;: con /refine el agente aplica mejoras pequeñas y con evidencia a sus prompts, memorias y skills, con rollback. Corre en daemon para trabajo de fondo y comunicación agente-a-agente. GitHub

Fuentes: https://github.com/PrimeIntellect-ai/prime-agent</description><pubDate>Mon, 10 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>github</category></item><item><title>&quot;How I use LLMs to learn complex topics&quot;: workflow práctico que dominó HN</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-10/#how-i-use-llms-to-learn-complex-topics-workflow</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-10/#how-i-use-llms-to-learn-complex-topics-workflow</guid><description>(716 puntos, últimas 24h). Un post con un método concreto para usar LLMs como tutor de temas complejos (descomposición, interrogación activa, verificación cruzada) que generó 460 comentarios con variantes y críticas. Útil como plantilla si usás modelos para estudio técnico. Post · HN

Fuentes: https://laurentiugabriel.github.io/blog/articles/how-i-use-llms-to-learn/ · https://news.ycombinator.com/item?id=49234675</description><pubDate>Mon, 10 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category></item><item><title>prime-agent (Prime Intellect) es de lo más caliente de GitHub trending hoy</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-09/#prime-agent-prime-intellect-es-de-lo-mas-caliente</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-09/#prime-agent-prime-intellect-es-de-lo-mas-caliente</guid><description>Agente open source (MIT) de coding e investigación para tareas largas, construido sobre dos ideas: un Recursive Language Model que trata el contexto como variables y a los subagentes como llamadas a función dentro de un REPL de IPython persistente, y un &quot;continual harness&quot; que persiste memorias, skills y specs de subagentes como estado durable que el agente refina con updates chicos respaldados por evidencia. La v0.7.0 salió el 5-ago y el repo está en el top del trending de esta mañana (GitHub, OSSInsight). Si estás armando agentes long-running, vale la pena mirar el diseño del harness.

Fuentes: https://github.com/PrimeIntellect-ai/prime-agent · https://ossinsight.io/trending/ai</description><pubDate>Sun, 09 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>github</category></item><item><title>La fiebre de los agent skills sigue escalando: tres directorios en el trending</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-09/#la-fiebre-de-los-agent-skills-sigue-escalando-tres</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-09/#la-fiebre-de-los-agent-skills-sigue-escalando-tres</guid><description>mattpocock/skills quedó #1 del Skill Leaderboard al 8-ago con skills de ingeniería (domain modeling, ADRs, code review contra specs), acompañado en el trending por google/skills (skills oficiales para productos Google) y addyosmani/agent-skills (24 bundles SKILL.md production-grade, 77k estrellas). Lo accionable: el formato SKILL.md ya es el estándar de facto entre harnesses — empaquetar tus workflows repetibles como skills es hoy la vía más barata de mejorar rendimiento de agentes.

Fuentes: https://github.com/mattpocock/skills · https://www.skillleaderboard.com/ · https://github.com/google/skills · https://github.com/addyosmani/agent-skills</description><pubDate>Sun, 09 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>google</category></item><item><title>Tip práctico del día: convertí pasos repetibles de skills en scripts testeados, no en prompts</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-09/#tip-practico-del-dia-converti-pasos-repetibles-de-skills</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-09/#tip-practico-del-dia-converti-pasos-repetibles-de-skills</guid><description>El TechBeat del 8-ago destaca esa guía: si un paso de un workflow de agente es determinístico, moverlo de instrucción en prompt a script testeado que el agente invoca reduce variancia y tokens (HackerNoon). Alineado con cómo están diseñados los harnesses tipo prime-agent: menos prosa en el contexto, más herramientas verificables.

Fuentes: https://hackernoon.com/8-8-2026-techbeat</description><pubDate>Sun, 09 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category></item><item><title>cloudflare/computer: &quot;dale una computadora a tu agente&quot;, no un contenedor</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-08/#cloudflare-computer-dale-una-computadora-a-tu-agente-no</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-08/#cloudflare-computer-dale-una-computadora-a-tu-agente-no</guid><description>Cloudflare abrió @cloudflare/computer, un filesystem virtual que vive dentro de un Durable Object (estado autoritativo en SQLite) con superficie de ejecución pluggable. Trae tres backends: Container (FUSE mount real con un daemon computerd y userland Linux completo), Isolate shell (just-bash en un Dynamic Worker) e Isolate JavaScript (módulo ESM con node:fs/promises respaldado por el Workspace). Interesante para dar a los agentes un entorno de ejecución persistente y barato sin levantar contenedores completos. (GitHub, Cloudflare Blog)

Fuentes: https://github.com/cloudflare/computer · https://blog.cloudflare.com/cloudflare-computer/</description><pubDate>Sat, 08 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>github</category><category>linux</category></item><item><title>Repos que explotan en GitHub Trending (7 ago)</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-08/#repos-que-explotan-en-github-trending-7-ago</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-08/#repos-que-explotan-en-github-trending-7-ago</guid><description>Entre los que suben: cloudflare/computer (arriba), mattpocock/skills (skills reutilizables para agentes), firecrawl/pdf-inspector (librería Rust rápida que detecta PDFs escaneados vs. texto y extrae contenido) y TencentCloud/TencentDB-Agent-Memory (hub de memoria a nivel equipo que convierte conversaciones, docs y código en &quot;memory assets&quot; gobernados y compartidos entre agentes y frameworks). Buen material para probar en pipelines de agentes y RAG. (OSSInsight Trending AI)

Fuentes: https://ossinsight.io/trending/ai</description><pubDate>Sat, 08 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>github</category></item><item><title>Guía de Anthropic sobre harnesses para agentes de larga duración</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-08/#guia-de-anthropic-sobre-harnesses-para-agentes-de-larga</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-08/#guia-de-anthropic-sobre-harnesses-para-agentes-de-larga</guid><description>Anthropic publicó &quot;Effective harnesses for long-running agents&quot;, con prácticas accionables: mantener el archivo de instrucciones top-level corto (~100 líneas) como índice hacia un docs/ estructurado, guardar planes/specs en el directorio del proyecto para que el agente los referencie, y automatizar el setup del entorno con scripts de init para no gastar contexto en instalaciones. Aplicable directamente a scaffolding de agentes de coding. (Anthropic Engineering)

Fuentes: https://www.anthropic.com/engineering/effective-harnesses-for-long-running-agents</description><pubDate>Sat, 08 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>anthropic</category></item><item><title>Técnica: consenso en inference-time para mitigar comportamientos ocultos del fine-tuning</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-08/#tecnica-consenso-en-inference-time-para-mitigar-comportamientos-ocultos</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-08/#tecnica-consenso-en-inference-time-para-mitigar-comportamientos-ocultos</guid><description>El paper &quot;Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning&quot; (arXiv 2607.23394) propone entrenar varios modelos de referencia sobre datasets distintos y agregar sus distribuciones de próximo token en el decoding vía &quot;consensus decoders&quot; (un mínimo token-wise y una variante base-relative). Útil como defensa práctica frente a backdoors o sesgos introducidos por fine-tuning, sin re-entrenar. (Nota: es del 25 de julio; se incluye por su relevancia accionable ante los incidentes de seguridad de agentes de esta semana.) (arXiv)

Fuentes: https://arxiv.org/abs/2607.23394</description><pubDate>Sat, 08 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category></item><item><title>Parcheá tus harnesses de agentes: fallas en AWS, Google y Vercel permitían disparar tools sin pasar por el modelo</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-07/#parchea-tus-harnesses-de-agentes-fallas-en-aws-google</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-07/#parchea-tus-harnesses-de-agentes-fallas-en-aws-google</guid><description>Instrucciones forjadas podían llegar a las tools de un agente sin que ningún turno del modelo las autorizara — o sea, system prompts y guardrails nunca intervenían. Afectados: Bedrock AgentCore (InvokeHarness, ya corregido en el servicio), Google ADK para Python (corregido en 2.5.0) y Vercel @ai-sdk/harness-codex (fix en 1.0.29) / @ai-sdk/harness-opencode (1.0.28). Accionable: actualizá versiones y no expongas endpoints de harness a input no confiable. (6/8) The Hacker News

Fuentes: https://thehackernews.com/2026/08/aws-google-and-vercel-patch-agent-flaws.html</description><pubDate>Fri, 07 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>google</category><category>amazon</category></item><item><title>Qué está explotando en GitHub: agentes con memoria de equipo y skills</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-07/#que-esta-explotando-en-github-agentes-con-memoria-de</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-07/#que-esta-explotando-en-github-agentes-con-memoria-de</guid><description>Entre lo más trending del día: cloudflare/computer, mattpocock/skills (framework de skills agénticas y metodología de desarrollo), TencentDB-Agent-Memory (hub de memoria de equipo que convierte chats, docs y código en cuatro activos reutilizables compartidos entre agentes) y DeepSeek-Reasonix (agente de coding para terminal diseñado alrededor de la estabilidad del prefix-cache). El patrón: memoria compartida y skills reutilizables como capa estándar del stack de agentes. (7/8) OSSInsight

Fuentes: https://ossinsight.io/trending/ai</description><pubDate>Fri, 07 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>github</category></item><item><title>Papers frescos de agentes en arXiv: runtimes de largo horizonte y memoria jerárquica</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-07/#papers-frescos-de-agentes-en-arxiv-runtimes-de-largo</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-07/#papers-frescos-de-agentes-en-arxiv-runtimes-de-largo</guid><description>De los últimos dos días: &quot;Argus&quot;, un runtime agéntico de propósito general para razonamiento de largo horizonte; &quot;ABSeeker&quot;, que entrena agentes de búsqueda con asignación de crédito retropropagada desde la respuesta; y trabajos de memoria jerárquica en grafos con localización a nivel de paths. Útiles si estás armando agentes que corren horas: el cuello de botella ya no es el modelo sino el scaffolding de memoria y crédito. (5-6/8) arXiv cs.MA recent

Fuentes: https://arxiv.org/list/cs.MA/recent</description><pubDate>Fri, 07 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category></item><item><title>&quot;AI Recommendation Poisoning&quot;: botones &quot;Ask AI&quot; que alteran la memoria de tu asistente</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-07/#ai-recommendation-poisoning-botones-ask-ai-que-alteran-la</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-07/#ai-recommendation-poisoning-botones-ask-ai-que-alteran-la</guid><description>Sitios comerciales están embebiendo prompts ocultos en deep links pre-llenados (&quot;Ask AI&quot;): al clickearlos logueado en ChatGPT, Claude, Gemini o Grok, la query se ejecuta sin confirmación y algunas instruyen al asistente a guardar el dominio del vendor como &quot;fuente confiable&quot;, sesgando respuestas futuras. Microsoft ya catalogó 31 empresas haciéndolo. Accionable: desconfiá de esos botones y revisá periódicamente la memoria persistente de tus asistentes. (6/8) The Hacker News

Fuentes: https://thehackernews.com/2026/08/ai-recommendation-poisoning-how-ask-ai.html</description><pubDate>Fri, 07 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>microsoft</category><category>gpt</category><category>claude</category><category>gemini</category><category>grok</category></item><item><title>JudgeArena: framework unificado para evaluación reproducible con LLM-as-judge</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-06/#judgearena-framework-unificado-para-evaluacion-reproducible-con-llm-as</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-06/#judgearena-framework-unificado-para-evaluacion-reproducible-con-llm-as</guid><description>(paper, 5 ago). Ataca la fragmentación del ecosistema de benchmarks con jueces LLM: un marco común para correr y reproducir evaluaciones. Accionable si estás armando evals propios y querés comparabilidad entre modelos jueces. Fuente: arXiv:2608.02620.

Fuentes: https://arxiv.org/abs/2608.02620</description><pubDate>Thu, 06 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category></item><item><title>&quot;Beyond the Hivemind&quot;: meta-persona anchoring + temperature scaling secuencial contra la homogeneidad de LLMs</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-06/#beyond-the-hivemind-meta-persona-anchoring-temperature-scaling-secuencial</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-06/#beyond-the-hivemind-meta-persona-anchoring-temperature-scaling-secuencial</guid><description>(paper, 5 ago). Propone dos técnicas concretas de prompting/decoding para escapar del efecto &quot;hivemind&quot; (respuestas convergentes y homogéneas entre modelos). Útil para generación creativa, datos sintéticos diversos y ensembles. Fuente: arXiv:2608.02618.

Fuentes: https://arxiv.org/abs/2608.02618</description><pubDate>Thu, 06 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category></item><item><title>MemArena: benchmark ego-céntrico para asistentes con memoria personal on-device</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-06/#memarena-benchmark-ego-centrico-para-asistentes-con-memoria-personal</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-06/#memarena-benchmark-ego-centrico-para-asistentes-con-memoria-personal</guid><description>(paper, 5 ago). Evalúa cómo manejan modelos open-weight la memoria agéntica sobre conversaciones privadas en el dispositivo — relevante si construís agentes con memoria persistente y te importa qué modelo local usar. Fuente: arXiv:2608.02613.

Fuentes: https://arxiv.org/abs/2608.02613</description><pubDate>Thu, 06 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category></item><item><title>Tokens de n8n filtrados en GitHub daban acceso real a 321 instancias</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-06/#tokens-de-n8n-filtrados-en-github-daban-acceso-real</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-06/#tokens-de-n8n-filtrados-en-github-daban-acceso-real</guid><description>(5 ago). GitGuardian encontró 4.576 tokens únicos en commits públicos; el 36% de las instancias alcanzables aceptaba al menos uno, exponiendo workflows y credenciales downstream (DBs, repos, cloud, servicios de IA). Práctica concreta: escanear secretos en CI, rotar tokens de n8n y restringir acceso de red a la instancia. Fuente: The Hacker News.

Fuentes: https://thehackernews.com/2026/08/leaked-n8n-api-tokens-exposed-live.html</description><pubDate>Thu, 06 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>github</category></item><item><title>Simon Willison: un juego completo &quot;one-shot&quot; con Claude Fable 5</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-06/#simon-willison-un-juego-completo-one-shot-con-claude</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-06/#simon-willison-un-juego-completo-one-shot-con-claude</guid><description>(post, 5 ago). Willison repitió su experimento de 2024 (GPT-3 + DALL-E) y generó un juego funcional de una sola pasada, buen ejemplo práctico de hasta dónde llegó la generación de código de una sola instrucción. Fuente: vía LLM Stats.

Fuentes: https://llm-stats.com/ai-news</description><pubDate>Thu, 06 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>claude</category></item><item><title>Microsoft Research libera Orchard, framework abierto para agentes a escala</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-05/#microsoft-research-libera-orchard-framework-abierto-para-agentes-a</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-05/#microsoft-research-libera-orchard-framework-abierto-para-agentes-a</guid><description>Publicado el 4 de agosto. Su núcleo es Orchard Env, un servicio de entornos aislados sobre Kubernetes que permite entrenar y evaluar agentes dentro de los harnesses reales de deployment (Claude Code, Codex, OpenClaw), cerrando la brecha entrenamiento-producción. Incluye tres recetas (Orchard-SWE, Orchard-GUI, Orchard-Claw) con mejoras medibles en ingeniería de software, automatización de navegador y asistentes, y liberan datos de entrenamiento y métodos de eval completos. Accionable si hacés RL o evals de agentes sin depender de cloud propietario. Microsoft Research · AI Business

Fuentes: https://www.microsoft.com/en-us/research/blog/orchard-an-open-framework-for-scalable-agentic-ai/ · https://aibusiness.com/agentic-ai/microsoft-framework-cut-ai-agent-training-costs</description><pubDate>Wed, 05 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>microsoft</category><category>claude</category><category>claude-code</category></item><item><title>rust-lang/rust adopta política de LLMs: &quot;analizar sí, crear no&quot;</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-05/#rust-lang-rust-adopta-politica-de-llms-analizar-si</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-05/#rust-lang-rust-adopta-politica-de-llms-analizar-si</guid><description>Publicada el 5 de agosto en el blog Inside Rust: cinco equipos del proyecto acordaron que los LLMs pueden usarse para &quot;responder preguntas, analizar, destilar, refinar, chequear, sugerir, revisar&quot; pero no para crear código en PRs al monorepo. No es postura oficial de todo el proyecto, pero es uno de los precedentes más claros de gobernanza de contribuciones con IA en open source de gran escala — probable plantilla para otros proyectos. Inside Rust Blog · Hacker News

Fuentes: https://blog.rust-lang.org/inside-rust/2026/08/05/rust-langrust-is-adopting-an-llm-policy/ · https://news.ycombinator.com/item?id=49179039</description><pubDate>Wed, 05 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category></item><item><title>OpenAI baja precios de GPT-5.6 y estrena &quot;Fast mode&quot; en la API</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-05/#openai-baja-precios-de-gpt-5-6-y-estrena</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-05/#openai-baja-precios-de-gpt-5-6-y-estrena</guid><description>El 4 de agosto recortó los precios de GPT-5.6 Luna y Terra y lanzó un modo rápido para GPT-5.6 Sol en la API, además de ampliar el acceso enterprise en ChatGPT Work, Codex y la API. Accionable: si tenés pipelines sobre estos modelos, conviene rehacer el cálculo de costos y probar Fast mode donde la latencia manda. Releasebot — OpenAI updates --- Fuentes verificadas por búsqueda web el 2026-08-05. Nota: Qwen3.8-Max (Alibaba, 2.4T parámetros MoE) se lanzó el 3 de agosto — fuera de la ventana de 24h — con open weights prometidos para esta semana; vale la pena seguirlo.

Fuentes: https://releasebot.io/updates/openai</description><pubDate>Wed, 05 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>openai</category><category>alibaba</category><category>gpt</category></item><item><title>Trending de hoy en agentes: yc-software/qm y cloudflare/computer</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-04/#trending-de-hoy-en-agentes-yc-software-qm-y</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-04/#trending-de-hoy-en-agentes-yc-software-qm-y</guid><description>. qm (&quot;multiplayer agent harness for work&quot;, +41k estrellas) apunta a coordinar varios agentes sobre trabajo compartido, y Cloudflare publicó computer, primitiva para darle a tu agente una computadora sandboxeada. Si estás armando scaffolding de agentes, los dos valen una mirada hoy. qm en Trendshift · cloudflare/computer

Fuentes: https://trendshift.io/repositories/98877 · https://trendshift.io/repositories/101796</description><pubDate>Tue, 04 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category></item><item><title>Memoria de equipo para agentes: TencentDB-Agent-Memory</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-04/#memoria-de-equipo-para-agentes-tencentdb-agent-memory</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-04/#memoria-de-equipo-para-agentes-tencentdb-agent-memory</guid><description>. Hub de memoria a nivel equipo que convierte conversaciones, docs y código en cuatro activos reutilizables (Chat Memory, Skills, LLM-Wiki, Code-Graph) gobernados y compartidos entre agentes y frameworks. Interesante como patrón si tus agentes pisan el mismo contexto una y otra vez. Trendshift

Fuentes: https://trendshift.io/repositories/29310</description><pubDate>Tue, 04 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category></item><item><title>Inferencia local en máquinas chicas vuelve al trending: AirLLM y DeepSeek-Reasonix</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-04/#inferencia-local-en-maquinas-chicas-vuelve-al-trending-airllm</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-04/#inferencia-local-en-maquinas-chicas-vuelve-al-trending-airllm</guid><description>. AirLLM (70B en una GPU de 4GB, +30k estrellas) resurgió en el ranking diario, y DeepSeek-Reasonix es un coding agent de terminal diseñado alrededor de la estabilidad del prefix-cache — patrón a copiar: mantener el prefijo estable abarata y acelera sesiones largas de agente. AirLLM · DeepSeek-Reasonix

Fuentes: https://trendshift.io/repositories/18741 · https://trendshift.io/repositories/27020</description><pubDate>Tue, 04 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category></item><item><title>Deadline de migración: Moonshot da de baja kimi-k2.5 y todos los strings moonshot-v1 el 31/8</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-04/#deadline-de-migracion-moonshot-da-de-baja-kimi-k2</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-04/#deadline-de-migracion-moonshot-da-de-baja-kimi-k2</guid><description>(confirmado 3/8). Quedan ~27 días: si tenés apps apuntando a esos model strings, migrá ya a los identificadores nuevos para evitar cortes. AI Agents News — semana del 3/8

Fuentes: https://aiagentstore.ai/ai-agent-news/this-week</description><pubDate>Tue, 04 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>moonshot</category></item><item><title>Tooling de documentos para agentes: OfficeCLI y firecrawl/pdf-inspector</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-04/#tooling-de-documentos-para-agentes-officecli-y-firecrawl-pdf</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-04/#tooling-de-documentos-para-agentes-officecli-y-firecrawl-pdf</guid><description>. OfficeCLI (binario único, open source) permite a agentes leer/editar Word, Excel y PowerPoint sin Office instalado, con soporte MCP; pdf-inspector (Rust, de Firecrawl) clasifica PDFs escaneados vs. de texto para rutear inteligentemente OCR vs. extracción directa — piezas útiles para pipelines de documentos. OfficeCLI · pdf-inspector

Fuentes: https://trendshift.io/repositories/24391 · https://trendshift.io/repositories/26016</description><pubDate>Tue, 04 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>mcp</category></item><item><title>Meta AI usa un segundo agente como &quot;memory coach&quot; para tareas largas</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-03/#meta-ai-usa-un-segundo-agente-como-memory-coach</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-03/#meta-ai-usa-un-segundo-agente-como-memory-coach</guid><description>Para evitar que los agentes olviden errores ya diagnosticados y repitan pasos fallidos, Meta introduce un agente de memoria separado que mantiene un banco estructurado y decide qué recordar durante tareas complejas. Patrón accionable de memory engineering para scaffolding de agentes multi-paso. The Decoder / feed LLM Stats

Fuentes: https://llm-stats.com/ai-news</description><pubDate>Mon, 03 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>meta</category></item><item><title>Tutorial práctico: reemplazar un proceso de booking con un agente LangGraph + Langfuse</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-03/#tutorial-practico-reemplazar-un-proceso-de-booking-con-un</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-03/#tutorial-practico-reemplazar-un-proceso-de-booking-con-un</guid><description>Guía paso a paso para construir, correr y monitorear un agente de soporte con estado usando Python, LangGraph y Langfuse (observabilidad). Directamente reproducible para quien quiera pasar de PoC a un agente instrumentado. Planet AI / feed LLM Stats

Fuentes: https://llm-stats.com/ai-news</description><pubDate>Mon, 03 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category></item><item><title>Presence como referencia de &quot;agente en producción&quot;</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-03/#presence-como-referencia-de-agente-en-produccion</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-03/#presence-como-referencia-de-agente-en-produccion</guid><description>Más allá de la noticia, el diseño de OpenAI Presence —razonamiento del modelo envuelto en políticas, testing/evals y reglas de escalado a humano— es una plantilla útil de mejores prácticas para llevar agentes a producción con guardrails y evaluación continua. OpenAI

Fuentes: https://openai.com/index/introducing-openai-presence/</description><pubDate>Mon, 03 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>openai</category></item><item><title>Microsoft libera Flint, un lenguaje de gráficos pensado para que los LLMs los generen sin romperse</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-02/#microsoft-libera-flint-un-lenguaje-de-graficos-pensado-para</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-02/#microsoft-libera-flint-un-lenguaje-de-graficos-pensado-para</guid><description>Microsoft Research publicó Flint, un DSL open source de visualización posicionado como reemplazo de Vega-Lite y diseñado para que los modelos generen gráficos de forma confiable a partir de datos tabulares. La propuesta: gramática más corta, menos overhead de tokens y rendering predecible cuando el modelo compone vistas al vuelo. Accionable para cualquiera que arme dashboards o reporting con agentes. (microsoft.github.io)

Fuentes: https://microsoft.github.io/flint-chart/</description><pubDate>Sun, 02 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>microsoft</category></item><item><title>β-OPSD: generaliza el self-distillation on-policy y mejora razonamiento matemático sin RL caro</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-02/#opsd-generaliza-el-self-distillation-on-policy-y-mejora</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-02/#opsd-generaliza-el-self-distillation-on-policy-y-mejora</guid><description>Investigadores de la Universidad de Maryland reformulan el on-policy self-distillation (OPSD) como el caso β=1 de una familia más amplia que ajusta el ancla KL entre las políticas de estudiante, referencia y profesor. El óptimo cerrado se convierte en una mezcla de logits usada como target de destilación, evitando RL costoso, con mejoras consistentes de estabilidad y accuracy en benchmarks de matemática sobre el OPSD estándar. (huggingface.co)

Fuentes: https://huggingface.co/papers/2607.28582</description><pubDate>Sun, 02 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category></item><item><title>Un paper reencuadra el diseño de routers MoE: los co-expertos interactúan, no se complementan</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-02/#un-paper-reencuadra-el-diseno-de-routers-moe-los</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-02/#un-paper-reencuadra-el-diseno-de-routers-moe-los</guid><description>Zhejiang University y Hong Kong PolyU introducen un Expert Subspace Separation Index y un protocolo factorial 2x2 que muestra que los expertos co-seleccionados en Mixture-of-Experts no aportan direcciones de representación distintas, como se suele asumir. Intervenciones con ruta congelada exponen un &quot;solapamiento coherente&quot; donde candidatos fuertes interactúan negativamente: útil para repensar el diseño de routers sparse tipo Mixtral/DeepSeek. (huggingface.co)

Fuentes: https://huggingface.co/papers/2607.28308</description><pubDate>Sun, 02 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category><category>deepseek</category></item><item><title>Fairness Pruning: 40 neuronas alcanzan para mover el sesgo demográfico en LLMs de 3B</title><link>https://elcompilado.com/blog/briefing-tech-2026-08-02/#fairness-pruning-40-neuronas-alcanzan-para-mover-el-sesgo</link><guid isPermaLink="true">https://elcompilado.com/blog/briefing-tech-2026-08-02/#fairness-pruning-40-neuronas-alcanzan-para-mover-el-sesgo</guid><description>Un nuevo paper muestra que poner en cero apenas 40 neuronas (0,031% del ancho de MLP en modelos de hasta 3B) mueve de forma medible el sesgo demográfico conservando el 99,49% de la capacidad general. La intervención produce una &quot;desestabilización&quot; bidireccional del sesgo más que una reducción limpia, porque captura magnitud y no dirección: señal interesante para equipos de interpretabilidad y alignment que exploran circuitos disociables. (huggingface.co)

Fuentes: https://huggingface.co/papers/2607.28319</description><pubDate>Sun, 02 Aug 2026 00:00:00 GMT</pubDate><category>tecnicas</category></item></channel></rss>