Gestión de Producto de IA

The Agentic

Un resumen semanal para líderes de producto que construyen con agentes de IA y modelos de lenguaje grandes, enfocado en estrategia de producto, UX, arquitectura, implementación y evidencia que importa.

El arnés se está volviendo más importante que la conversación

La investigación más sólida de la semana sugiere que el estado duradero debe vivir en la aplicación, no dentro de un historial de chat que se expande sin fin. También muestra por qué el éxito funcional no basta: un agente puede producir el resultado correcto mientras viola una política, se apoya en evidencia obsoleta o pasa una evaluación frágil.

Ilustración de GitHub con cubos verdes conectados y símbolos de desarrollo
GitHub lanza ReviewBench para la revisión de código con IAGitHub
arXiv02

SWE-CC mide si el código correcto sigue la política del repositorio

SWE-CC convierte la documentación de desarrolladores en 823 políticas verificables por máquina y audita tanto el comportamiento del agente como el resultado final. Los agentes violaron el 43.1% de las políticas aplicables incluso cuando sus parches eran funcionalmente correctos, lo que muestra por qué “la prueba pasó” no es una definición completa de terminado.

Lee el artículo
arXiv03

TRACE diagnostica la evaluación frágil de agentes

TRACE usa cambios controlados y una nueva puntuación para determinar si un cambio en el puntaje refleja el comportamiento del agente o al evaluador. Reintentos idénticos cambiaron entre 15% y 36% de los resultados, mientras que dos jueces de frontera no coincidieron en el 57% de los mismos registros.

Lee el artículo
arXiv06

Agent Skill Evolution mide el valor y el costo de las instrucciones

A través de miles de revisiones de Skills, las reglas explícitas mejoraron el cumplimiento de acciones requeridas y la corrección final, especialmente cuando nombraban un comando o ruta faltante. Cargar cuerpos completos de Skills también aumentó considerablemente el uso de tokens, lo que refuerza el caso a favor de una recuperación de instrucciones acotada y relevante.

Lee el artículo
arXiv07

Un caso de salud revela los límites de que la IA supervise a la IA

Un flujo de trabajo de meta-agentes liderado por humanos usó agentes de codificación, revisión y monitoreo, pero algunas verificaciones midieron indicadores sustitutos, fallaron silenciosamente o desaparecieron de los reportes. El aseguramiento debe conectar el resultado deseado, la evidencia, los permisos y la decisión humana final, no simplemente agregar otro agente revisor.

Lee el artículo
arXiv09

Transect hace navegables las trazas largas de agentes

Transect alinea eventos de herramientas, uso de tokens, actividad de subagentes y etiquetas de comportamiento en una sola línea de tiempo, con cada interpretación vinculada a los turnos de origen. A medida que las ejecuciones de agentes abarcan cientos de páginas, la interfaz de supervisión tendrá que convertirse en un explorador de evidencia estructurado en lugar de un visor de transcripciones.

Lee el artículo

La conclusión

Saca el estado duradero del chat, define el éxito más allá del resultado final, y trata las evaluaciones, habilidades, políticas, evidencia y trazas como partes gobernadas del producto.