Gestion de produit IA

The Agentic

Un point hebdomadaire pour les responsables produit qui construisent avec des agents IA et des grands modèles de langage, centré sur la stratégie produit, l'UX, l'architecture, la mise en œuvre et les preuves qui comptent.

Le harnais devient plus important que la conversation

Les recherches les plus solides de la semaine suggèrent que l'état durable doit vivre dans l'application, pas dans un historique de conversation qui s'étend sans fin. Elles montrent aussi pourquoi le succès fonctionnel ne suffit pas : un agent peut produire le bon résultat tout en violant une politique, en s'appuyant sur des preuves obsolètes, ou en passant une évaluation fragile.

Illustration GitHub de cubes verts connectés et de symboles de développement
GitHub publie ReviewBench pour la revue de code par IAGitHub
arXiv02

SWE-CC mesure si un code correct respecte la politique du dépôt

SWE-CC transforme la documentation des développeurs en 823 politiques vérifiables par machine et audite à la fois le comportement de l'agent et le résultat final. Les agents ont violé 43,1 % des politiques applicables même lorsque leurs correctifs étaient fonctionnellement corrects, ce qui montre pourquoi « le test est passé » ne suffit pas à définir le travail terminé.

Lire l'article
arXiv03

TRACE diagnostique la fragilité de l'évaluation des agents

TRACE utilise des modifications contrôlées et une nouvelle notation pour déterminer si un changement de score reflète le comportement de l'agent ou celui de l'évaluateur. Des relances identiques ont fait basculer 15 à 36 % des résultats, tandis que deux juges de pointe étaient en désaccord sur 57 % des mêmes dossiers.

Lire l'article
arXiv05

MemTrace rend la mémoire des agents sensible à l'état

MemTrace relie les preuves d'exécution aux fichiers, symboles, tests et historique des dépendances, puis vérifie si l'information rappelée reste valide après modification du dépôt. C'est un meilleur modèle mental pour la mémoire en entreprise : des preuves versionnées, avec provenance et expiration.

Lire l'article
arXiv06

Agent Skill Evolution mesure la valeur et le coût des instructions

Sur des milliers de révisions de compétences, des règles explicites ont amélioré la conformité aux actions requises et la justesse finale, surtout quand elles nommaient une commande ou un chemin manquant. Charger des compétences complètes a aussi considérablement augmenté la consommation de jetons, renforçant l'intérêt d'une récupération d'instructions étroite et pertinente.

Lire l'article
arXiv07

Une étude de cas en santé révèle les limites de l'IA qui supervise l'IA

Un flux de travail multi-agents piloté par l'humain utilisait des agents de codage, de revue et de surveillance, pourtant certains contrôles mesuraient des indicateurs indirects, échouaient silencieusement ou disparaissaient des rapports. L'assurance qualité doit relier le résultat visé, les preuves, les permissions et la décision humaine finale, pas simplement ajouter un agent de revue de plus.

Lire l'article
arXiv09

Transect rend navigables les longues traces d'agents

Transect aligne sur une seule chronologie les événements d'outils, l'usage des jetons, l'activité des sous-agents et les étiquettes comportementales, chaque interprétation étant reliée aux tours d'origine. Les exécutions d'agents s'étalant sur des centaines de pages, l'interface de supervision devra devenir un explorateur de preuves structuré plutôt qu'un simple lecteur de transcription.

Lire l'article
Source originale: GitHub
GitHub10

GitHub repense son infrastructure pour le développement à l'échelle des agents

GitHub rapporte que l'activité Git mensuelle a plus que doublé, atteignant 473,3 milliards d'événements, tandis que le volume de commits de septembre a dépassé cinq fois son niveau d'un an plus tôt. Les flottes d'agents transforment la charge de travail elle-même avec des points de contrôle rapides, des écritures soutenues, des conflits de fusion et une explosion des pipelines CI.

Lire l'analyse d'ingénierie

À retenir

Sortez l'état durable du chat, définissez le succès au-delà du résultat final, et traitez les évaluations, les compétences, les politiques, les preuves et les traces comme des composantes gouvernées du produit.