Skip to main content
04 / Journaux de construction

Histoires de la construction.

Ce qui a été difficile, ce qui a cassé, ce qui a survécu à la coupe, un billet par projet. Trié selon la récence du projet, pas du jour où je l'ai écrit.

Des pointages tapés au bord du terrain, sur le site avant le début de la partie suivante
Sept. 2026 à aujourd'hui
9 min de lecture

Des pointages tapés au bord du terrain, sur le site avant le début de la partie suivante

Montreal United offre du mentorat et du sport organisé aux jeunes de Montréal, dont deux tournois de basketball annuels. J'ai repris leur site WordPress bilingue en septembre 2026 et je leur ai bâti une deuxième chose qu'ils avaient demandée : une façon de gérer un tournoi depuis un téléphone, au gymnase. Les divisions, les poules, les parties générées et les pointages s'entrent sur le téléphone, et la page publique les reprend d'elle-même, en anglais et en français. La partie que j'ai la plus soignée est celle qui refuse, parce que la personne qui s'en sert est debout à la table des marqueurs avec une partie qui se termine derrière elle.

WordPressDiviWPML
Un agent qui refuse de mettre des mots dans la bouche de Canon : 21 citations sur 22 retrouvées mot pour mot dans les documents du fabricant
Sept. 2026
10 min de lecture

Un agent qui refuse de mettre des mots dans la bouche de Canon : 21 citations sur 22 retrouvées mot pour mot dans les documents du fabricant

Quand je travaillais en cinéma, mon Canon T5i manquait la mise au point en mode auto et je passais en manuel. Le manuel de Canon l'explique à la page 100, et je ne l'avais jamais lu. Ce genre de question de compatibilité a des réponses publiées, difficiles à trouver et faciles à mal citer, alors Will It Focus lit les documents des fabricants et refuse de les paraphraser entre guillemets. Deux points d'accès Sanity Context, un agent sur gpt-5.4-mini : 131 fiches typées servent les verdicts, une base de connaissances bâtie sur six PDF de fabricants sert les explications, et après la réponse du modèle, le code va chercher chaque citation dans la fiche citée. Sur 20 questions corrigées par les tableaux de Sigma, de Canon et de Metabones, 21 passages cités sur 22 sont mot pour mot. La première fois que je l'ai fait tourner sur la seule base de connaissances, il a mis des guillemets autour de 13 phrases qui n'apparaissent dans aucun des six documents, et c'est toute la raison pour laquelle le texte textuel vit maintenant dans des fiches typées.

Sanity ChallengeSanity ContextMCP
Le divan qui ne descendait pas l'escalier, et le téléphone qui le dit maintenant avant l'achat
Sept. 2026
11 min de lecture

Le divan qui ne descendait pas l'escalier, et le téléphone qui le dit maintenant avant l'achat

J'ai acheté un divan qui ne descendait pas l'escalier de mon sous-sol. La volée tourne à quatre-vingt-dix degrés sur trois marches balancées, et je l'ai appris à mi-chemin, le divan coincé et le mur éraflé. Puis un dégât d'eau a forcé le remplacement du chauffe-eau et deux installateurs ont descendu un réservoir de 279 litres par le même escalier. Deux objets, un escalier, personne n'a mesuré ni une fois ni l'autre. Elbow Room Mobile numérise une pièce avec un téléphone Android sans LiDAR, la rend comme un modèle 3D que vous pouvez concevoir, meubler et parcourir comme votre Sim, et répond à la question qu'aucune application de meubles ne pose : est-ce que la chose peut vraiment entrer. Un divan trois places dans la maison d'exemple passe la porte d'entrée et le corridor, puis perd de 2 pi 10 po au tournant. Le solveur derrière cela est vérifié contre la forme fermée publiée pour une tige de largeur nulle, qui est la seule partie du reçu dont je n'ai pas écrit la réponse.

RevenueCat ShipatonRevenueCatReact Native
Seize vrais appels à des pharmacies, zéro prix, et la raison mesurée : l'agent parle par-dessus le pharmacien
Sept. 2026
10 min de lecture

Seize vrais appels à des pharmacies, zéro prix, et la raison mesurée : l'agent parle par-dessus le pharmacien

Les pharmacies ont payé environ 43 cents pour trente metformine, un chiffre que le CMS publie chaque semaine à partir des factures. Ce que vous payez est différent à chaque comptoir et publié nulle part, donc la seule façon de le savoir est de téléphoner. Sticker donne à un agent téléphonique CALL-E un médicament et un code postal, lit le registre fédéral NPI, appelle les pharmacies que vous autorisez, et joint chaque prix cité au NADAC du CMS. Seize vrais appels dans un code postal de Manhattan ont produit zéro prix et zéro refus. Le flux d'événements de la plateforme a montré pourquoi : 24 collisions sur 15 appels tracés où l'agent ouvrait son tour pendant que le pharmacien parlait encore. Signalé en amont comme le problème no 415, pris par un mainteneur le jour même. La contribution fusionnée comme PR no 404 après cinq passes de révision. Zéro est un résultat si vous dites comment vous l'avez obtenu.

CALL-EPhone agentsCMS NADAC
Un assureur maintient son propre refus deux fois sur trois. Un médecin indépendant le renverse trois fois sur quatre. Day Thirty est l'appel que personne ne dépose
Sept. 2026
11 min de lecture

Un assureur maintient son propre refus deux fois sur trois. Un médecin indépendant le renverse trois fois sur quatre. Day Thirty est l'appel que personne ne dépose

Les assureurs ont maintenu 66 pour cent des appels reçus en 2024 (KFF). L'Independent Medical Review de la Californie a renversé 72,3 pour cent des refus parvenus à un médecin indépendant en 2025. Moins d'un pour cent des refus sont contestés, en partie à cause d'une horloge que personne n'explique : trente jours après le dépôt d'un grief, que le régime ait répondu ou non, un délai de six mois démarre. Day Thirty lit le refus avec Nova, calcule le délai à partir de la loi en citant chaque disposition, retrouve comment la Californie a réellement tranché 22 090 cas comparables, rédige l'appel avec Haiku 4.5 et s'arrête à une interruption Strands pour votre signature. 15,1 secondes en médiane jusqu'à un appel rédigé à la porte. Chaque chiffre noté par le registre de l'État.

AgentsForHumansAmazon BedrockStrands Agents
Votre camion canadien a déjà roulé cette voie à vide. Northbound trouve le fret qu'il aurait pu légalement transporter
Sept. 2026
10 min de lecture

Votre camion canadien a déjà roulé cette voie à vide. Northbound trouve le fret qu'il aurait pu légalement transporter

10 479 trajets complétés, 1 596 093 miles, deux mois de données de répartition réelles de Roadstar Trucking. Revenir à vide n'est arrivé que six fois. Le vrai roulage à vide est à l'intérieur des États-Unis, entre les chargements, et savoir s'il aurait pu transporter du fret s'avère une question juridique, pas une question d'itinéraire. Le 19 CFR 123.14(c)(1) permet le transport point à point aux États-Unis lorsqu'il fait partie du retour du véhicule vers son pays d'attache, donc le verdict dépend de la direction. 217 trajets, 66 702 miles, 155 815 $ au coût industriel 2025 de l'ATRI, se dirigeaient déjà vers la frontière et étaient légalement autorisés à transporter. GLM 5.2 sur SPUR lit l'offre, un moteur TypeScript déterministe cite le règlement. Ablation sur 100 offres réelles en cinq formats de courtiers : 100 % de verdict correct avec le modèle, 40 % sans.

RoadStarHackathonGLM 5.2SPUR Compute
Un assistant caméra porte des lunettes intelligentes pendant un tournage et quitte le plateau avec la feuille de continuité déjà écrite
Sept. 2026
10 min de lecture

Un assistant caméra porte des lunettes intelligentes pendant un tournage et quitte le plateau avec la feuille de continuité déjà écrite

Le dernier métier sur un tournage encore fait entièrement sur papier, c'est la continuité. Manquez une ligne, découvrez-la au montage, payez un jour de reprises à 1 440 $ ou 3 020 $ (Giggster 2026). Dailies surveille une prise via des Ray-Ban Meta Gen 2 pour 1,6 cent aux tarifs Gemini publiés par Google, 63 cents une journée de quarante prises, 0,04 % de la journée qu'elle protège. Gemini lit chaque prise, ClickHouse Cloud garde les observations, et une boîte à questions en anglais simple laisse un agent écrire son propre SQL via le serveur officiel mcp-clickhouse. L'agent ne peut pas détruire de données : trois couches indépendantes, et celle qui compte est un compte cluster en lecture seule refusant DROP, INSERT, TRUNCATE, CREATE TABLE et ALTER avec le code ClickHouse 497. Le verdict médian en direct est de 4,4 secondes, prononcé dans l'oreille du porteur. Le moment clé dans la démo de 2 min 31 s tombe à 0:49.

AgenticCinemaClickHouseRay-Ban Meta
Le canapé a emporté un morceau du mur du sous-sol en sortant. J'ai construit le planificateur que personne ne m'a vendu
Sept. 2026
9 min de lecture

Le canapé a emporté un morceau du mur du sous-sol en sortant. J'ai construit le planificateur que personne ne m'a vendu

Chaque planificateur de pièce jamais construit répond est-ce que ça rentre dans la pièce. Elbow Room répond à la question qui coûte de l'argent et du plâtre : est-ce que ça peut seulement y arriver. A prédit deux résultats réels chez moi qui s'étaient déjà produits (un canapé qui n'est pas passé, un chauffe-eau de 279 litres qui est passé), s'accorde à 1,63 x 10^-6 pouces près avec une solution fermée vieille de 300 ans pour l'angle, et embarque 19 outils WebMCP pour qu'un agent puisse piloter le canvas en parlant. Bonus inter-origines : une boutique de meubles séparée peut interroger mon escalier via un outil partagé en lecture seule, les deux côtés consentent par leur nom.

WebMCPModel Context ProtocolCanvas
Je viens de publier mon premier cours Udemy : la construction de catalogue ServiceNow que j'ai faite vingt fois, plus le Now Assist Skill Kit de bout en bout
Sep. 2026
4 min de lecture

Je viens de publier mon premier cours Udemy : la construction de catalogue ServiceNow que j'ai faite vingt fois, plus le Now Assist Skill Kit de bout en bout

Deux ans dans l'équipe ServiceNow au Cirque du Soleil, plus une période sur du travail client à N2, m'ont appris quelles parties du stack catalogue + Flow Designer + Now Assist vous utilisez vraiment et lesquelles la doc vous fait croire importantes mais ne le sont pas. Le cours est ce filtre, enregistré à partir de zéro sur une instance neuve, terminé par un flux de publication Now Assist Skill Kit qui n'est pas encore dans la doc. Code promo de lancement à l'intérieur.

ServiceNowFlow DesignerNow Assist
Nightshift lit 2 000 brevets en 4 minutes pour 34 $ et trouve la référence que l'examinateur a manquée
Août 2026
11 min de lecture

Nightshift lit 2 000 brevets en 4 minutes pour 34 $ et trouve la référence que l'examinateur a manquée

Chaque outil d'antériorité existant est un système de récupération : classer un corpus, montrer à un humain le top-quelques-dizaines. Ça a un plafond mesurable : avec le meilleur embedding disponible, un top-50 rate encore 59,7 % des références qu'un examinateur USPTO a réellement appliquées. Nightshift est un système de jugement : une passe vectorielle réduit 171 695 brevets, puis Gemini en lit deux mille, pas cinquante, décidant pour chacun s'il divulgue chaque limitation. En aveugle contre les vraies citations d'actions d'office USPTO : 97,5 % de rappel des références d'anticipation appliquées par l'examinateur (n=40), 92,5 % sur l'obviousness (n=40), 18,8 % sur un ensemble de contrôle jamais cité. Sur la démo, 4 minutes sur 10 tâches Cloud Run, 34,57 $, il a fait remonter indépendamment la référence X-cite de l'examinateur à profondeur 218, plus une référence de 1998 que l'examinateur a manquée qui enseigne six des sept limitations en propre.

AllThingsAgenticTheTaskmasterGoogle Cloud
Python ne peut pas prendre une weakref sur un ValueError. La déduplication de Sentry l'a appris à ses dépens : 1024 Ko par tâche asyncio vivante.
Août 2026
Lauréat
12 min de lecture

Python ne peut pas prendre une weakref sur un ValueError. La déduplication de Sentry l'a appris à ses dépens : 1024 Ko par tâche asyncio vivante.

La DedupeIntegration de sentry-python empêche qu'une même erreur soit rapportée deux fois en se souvenant de la dernière exception. Se souvenir d'une exception est exactement ce qu'il ne faut pas faire : une exception détient sa traceback, une traceback détient ses frames, un frame détient chaque local. Le SDK le savait et stockait un weakref.ref(exc). Les trois lignes sous le commentaire `# we can only weakref non builtin types` font la seule chose que la weakref existait pour empêcher : un `except TypeError:` attrape le refus de Python de prendre une weakref sur un builtin et retient silencieusement l'exception. Sous asyncio, chaque tâche garde sa propre copie dans un ContextVar, donc 200 sessions de longue durée épinglent 205 Mo, toutes atteignables après gc.collect(). Deux tentatives avant le correctif, une empreinte par valeur qui échoue aux propres tests du SDK, une empreinte basée sur id qui écrase 2000 erreurs distinctes en 2 clés, puis l'approche du jeton d'identité qui garde le comportement inchangé et fait tomber la rétention à 0,5 Mo.

BugSmashClearTheLineupSentry
Still Here : tout le monde croit que les chiens noirs sont laissés pour compte. J'ai vérifié 99 916 dossiers de refuge. Ce n'est pas vrai.
Août 2026
Lauréat
10 min de lecture

Still Here : tout le monde croit que les chiens noirs sont laissés pour compte. J'ai vérifié 99 916 dossiers de refuge. Ce n'est pas vrai.

510 chiens ont un enregistrement d'entrée au refuge d'Austin et aucun enregistrement de sortie. Still Here est le tableau, ordonné selon la durée d'attente. Celui en tête est Pancho, 449 jours. Puis j'ai cherché la raison pour laquelle les chiens en tête sont ceux en tête, et la réponse m'a surpris : le syndrome du chien noir n'apparaît pas dans 99 916 séjours complétés, les couleurs qui attendent sont les pelages des chiens de type bully. À race constante, le pelage déplace la médiane d'au plus 7,5 jours ; changer la race et elle bouge de 20.

WeekendChallengeDogDaysSnowflake
Assay : un tracker soin de la peau avec une barre d'erreur. Recadrer la même photo déplace la texture de 5,81 points, alors un verdict ne s'affiche que si le changement dépasse ce plancher sur votre visage.
Août 2026
11 min de lecture

Assay : un tracker soin de la peau avec une barre d'erreur. Recadrer la même photo déplace la texture de 5,81 points, alors un verdict ne s'affiche que si le changement dépasse ce plancher sur votre visage.

La mesure existe : l'API YouCam Skin Analysis note seize résultats de peau depuis une photographie, et c'est un vrai bon instrument (entrée octet-identique donne sortie octet-identique). Le problème est qu'un score rapporté sans son erreur est un nombre avec lequel on ne peut pas prendre de décision. Sur mon propre visage avec une variable changée à la fois, la luminosité ±8 % déplace les boutons de 4,85 points et recadrer la même photo différemment déplace la texture de 5,81. Un effet de traitement réaliste sur quatre semaines est d'environ cinq. Assay mesure sa propre erreur d'abord, puis n'appelle un changement réel que quand il dépasse ce plancher.

YouCamHackathonYouCam Skin Analysis APIPerfect Corp
Unsay : un agent IA de sécurité médicamenteuse qui revient et défait ce qu'il a dit. Quand la FDA élève un rappel, il corrige chaque patient nommé qu'il avait déjà rassuré, en quelques secondes.
Août 2026
Lauréat
13 min de lecture

Unsay : un agent IA de sécurité médicamenteuse qui revient et défait ce qu'il a dit. Quand la FDA élève un rappel, il corrige chaque patient nommé qu'il avait déjà rassuré, en quelques secondes.

La mémoire d'agent a un mode d'échec que la qualité de récupération ne peut pas réparer : le contexte périmé. La similarité à une mémoire stockée ne prouve pas que la mémoire est encore vraie. Pour la plupart des agents c'est embarrassant. Dans une pharmacie c'est un rappel de Classe I. Le correctif d'Unsay est un schéma bitemporel sur CockroachDB (`valid_from`/`valid_to` pour le monde, `asserted_at`/`retracted_at` pour la croyance de ce système), et un join qu'aucune base vectorielle ne peut exprimer : chaque réponse encore debout qui s'appuyait sur une version d'affirmation qu'on ne croit plus. La relecture fonctionne encore au-delà de l'horizon AS OF SYSTEM TIME, et chaque correction est exactly-once à travers une panne de région.

CockroachDBHackathonCockroachDBBitemporal
Bloom : personne n'annule, on cesse simplement de venir. Bloom lit le rythme de visite propre à chaque client, signale ceux qui s'en écartent, et écrit une note personnelle à chacun. Les règles décident QUI, Gemini décide QUOI DIRE.
Juil.-août 2026
12 min de lecture

Bloom : personne n'annule, on cesse simplement de venir. Bloom lit le rythme de visite propre à chaque client, signale ceux qui s'en écartent, et écrit une note personnelle à chacun. Les règles décident QUI, Gemini décide QUOI DIRE.

Un salon typique perd environ 40 % de ses clients chaque année, un premier-timer qui ne re-réserve pas dans les 30 jours a environ une chance sur cinq de jamais revenir, et un habitué fidèle vaut plusieurs centaines de dollars par an. Le signal est invisible parce que c'est une absence, répartie sur des centaines de personnes qui ont chacune leur propre rythme. L'architecture de Bloom est l'idée : les règles décident QUI (moteur de risque déterministe sur l'écart de visite médian propre à chaque client), Gemini décide QUOI DIRE (une note courte dans la voix du propriétaire, référençant l'histoire réelle de cette personne). La démo de toute la thèse est deux clientes : Aisha et Jane sont toutes deux à 44 jours depuis leur dernière visite ; Aisha vient toutes les 8 semaines, Jane toutes les 4. Tout outil qui signale « pas de visite en 60 jours » se trompe sur l'une d'elles.

GeminiXPRIZEHackerFundGoogle Gemini 2.5 Flash
coldpath : le build Ollama Windows-on-Arm est expédié avec l'unité matricielle éteinte. Correctif d'une ligne déposé en amont, 5,75x sur le traitement de prompt.
Août 2026
12 min de lecture

coldpath : le build Ollama Windows-on-Arm est expédié avec l'unité matricielle éteinte. Correctif d'une ligne déposé en amont, 5,75x sur le traitement de prompt.

Je ne pouvais pas répondre à une question basique sur ma propre machine Arm : quand un LLM local tourne, utilise-t-il réellement l'unité matricielle de la puce, ou retombe-t-il silencieusement sur du code scalaire ? Alors j'ai écrit l'outil qui répond, l'ai pointé sur l'écosystème, et j'ai trouvé le runner LLM Windows-on-Arm le plus populaire froid. coldpath est un désassembleur AArch64 basé sur Capstone qui prouve qu'un binaire contient des instructions SME, i8mm et dotprod ; la trouvaille est que le build officiel win-arm64 d'Ollama en a zéro. Correctif d'une ligne déposé en amont (PR #17654), 5,75x récupéré sur le traitement de prompt mesuré en direct sur Azure Cobalt 100, gaté en CI comme GitHub Action réutilisable.

ArmCloudAIAArch64Neoverse N2
Culprit : une trace de pile pour la dérive de modèle. 90 322 $ d'erreur remontés à une seule colonne dont le max passe de 6 à 7.
Août 2026
Lauréat
13 min de lecture

Culprit : une trace de pile pour la dérive de modèle. 90 322 $ d'erreur remontés à une seule colonne dont le max passe de 6 à 7.

Fraîcheur, volume, taux de nuls et schéma étaient tous au vert. Le modèle se trompait discrètement depuis six mois. Culprit a remonté la lignée ML dans DataHub jusqu'à la colonne responsable, a déposé l'incident dans le graphe avec les dollars attachés, a écrit le correctif, a exécuté dbt build contre le vrai warehouse pour le vérifier, a rejeté son premier patch qui aurait supprimé 87 693 lignes, et seulement là a ouvert la PR. 90 322 $ d'erreur de modèle attribuable, chiffrés contre un contrôle contrefactuel sur 19,3 M de vrais enregistrements de taxi NYC.

BuildWithDataHubHackathonDataHubMCP
Overtone : description audio WCAG pour toute une archive vidéo à environ 0,03 $ la minute, générée sur place dans Backblaze B2
Juil. 2026
11 min de lecture

Overtone : description audio WCAG pour toute une archive vidéo à environ 0,03 $ la minute, générée sur place dans Backblaze B2

La WCAG exige une piste de description audio parlée sur les vidéos préenregistrées : un narrateur décrivant ce qui est à l'écran dans les pauses du dialogue. Les universités publiques doivent cela en vertu de la loi fédérale d'ici le 26 avril 2027, mais les descripteurs humains facturent 15 à 75 $ par minute finie, donc les archives restent sans description ou sont supprimées. Overtone lit chaque vidéo depuis un bucket Backblaze B2, génère la description sur place, et écrit le master décrit à côté de l'original. Mesuré sur un vrai cours MIT OpenCourseWare de 3 minutes : environ neuf cents pour décrire, soit environ trois cents la minute de bout en bout. Chaque étape générative passe par Genblaze, avec bascule automatique de fournisseur pour qu'un run à l'échelle d'une archive ne meure pas sur une seule erreur transitoire.

BackblazeGenblazeHackathonBackblaze B2Genblaze
Viva : 91 soumissions C notées au maximum sur 626 cachent un défaut que l'autograder n'a jamais testé
Juil. 2026
10 min de lecture

Viva : 91 soumissions C notées au maximum sur 626 cachent un défaut que l'autograder n'a jamais testé

Une suite de tests qui passe prouve qu'un programme a fonctionné sur les entrées que l'enseignant a pris la peine de vérifier. Elle ne prouve pas que l'étudiant peut expliquer ce que le programme fait. Viva comble cet écart : GPT-5.6 lit l'énoncé et propose une entrée que la suite n'a jamais essayée, Viva exécute le programme de l'étudiant et le corrigé dessus, et ne pose une question à l'étudiant que si les deux ne s'accordent pas. Sur 626 vraies soumissions C notées au maximum, 91 (14,5 %) cachent un défaut que l'autograder n'a jamais testé, et 83 d'entre elles (13,3 %) échouent sur une entrée aussi simple que `5 5 3`. Pas une prédiction, un rejeu : chaque constat porte une commande rejouable.

OpenAIBuildWeekGPT-5.6OpenAI Codex
LedgerPilot : même Qwen, même ledger, garde-fou désactivé poste 5 mauvaises écritures, activé en poste 0
Juil. 2026
12 min de lecture

LedgerPilot : même Qwen, même ledger, garde-fou désactivé poste 5 mauvaises écritures, activé en poste 0

La clôture mensuelle est le mauvais endroit pour donner un clavier à une IA qui hallucine. LedgerPilot est un agent de clôture où Qwen propose des écritures et un garde-fou déterministe est la seule voie vers une écriture. Le contrefactuel est toute la revendication : même planificateur qwen-flash, mêmes 39 tâches, même ledger Odoo en direct, garde-fou désactivé poste 5 mauvaises écritures (salaires payés depuis Comptes clients, coût des ventes vers Créances et Revenus, chacune équilibrée, chacune plausible), garde-fou activé poste 0. Le modèle ne s'est pas amélioré ; le ledger, oui. Tourne sur Alibaba Cloud ECS, pilote l'écriture via MCP.

QwenCloudHackathonQwenAlibaba Cloud
Clatterfall : une bille, un subreddit, une exécution partagée par jour, une machine que personne ne peut bâtir seul
Juil. 2026
11 min de lecture

Clatterfall : une bille, un subreddit, une exécution partagée par jour, une machine que personne ne peut bâtir seul

r/Clatterfall est une descente continue, bâtie par une foule, une pièce par personne par jour. Chaque matin, toute la machine engagée est ré-exécutée comme une simulation canonique unique que tout le monde regarde ensemble, et les pièces que la bille abandonne se dissolvent. Trois règles portent le poids : on ne peut bâtir que sur le chemin réel de la bille (la frontière), l'exécution quotidienne est simulée côté serveur une fois et rejouée identique au pixel partout, et les pièces que la bille cesse de toucher se dissolvent. Non-IA et fier de l'être : chaque pixel dessiné à partir de primitives Phaser Graphics à l'exécution.

RedditGamesHackathonReddit DevvitPhaser
Loose Ends : l'agent Slack qui refuse de fermer une boucle tant qu'il n'a pas vu la preuve
Juil. 2026
12 min de lecture

Loose Ends : l'agent Slack qui refuse de fermer une boucle tant qu'il n'a pas vu la preuve

Dans un Slack d'ONG ou d'entraide, un « quelqu'un peut faire un suivi avec la famille Diaz ? » lâché n'est pas un deck en retard, c'est une personne non servie. Chaque commitment bot du marché marque une boucle terminée quand une minuterie se déclenche ou quand quelqu'un clique « fait ». Loose Ends surveille le même canal pour un message ultérieur qui prouve que le travail a réellement eu lieu, et traite une échéance dépassée sans preuve comme BROKEN. Ancré dans un vrai chiffre : 93 % des dossiers de services sociaux ont été marqués fermés, seulement 38 % ont livré le service (JAMA Network Open, 2024). Fermé n'est pas fait.

SlackAgentHackSlack BoltSlack Real-Time Search
Pick Your Side : j'ai construit une machine qui vous fabrique une équipe de Coupe du monde, ancrée dans la vraie histoire
Juil. 2026
Lauréat
8 min de lecture

Pick Your Side : j'ai construit une machine qui vous fabrique une équipe de Coupe du monde, ancrée dans la vraie histoire

Toutes les apps Coupe du monde sont pour les gens qui suivent déjà. Celle-ci est pour tous les autres : on donne deux nations, elle lit leur vraie histoire, choisit le camp qu'on était censé aimer, et un annonceur de stade nous fait prêter serment. Toute l'architecture plie sur une règle : rien de l'histoire n'est inventé. Gemini fait la recherche avec le grounding Google Search actif, puis réécrit dans un responseSchema strict, puis ElevenLabs joue le tout sur une foule de stade qu'ElevenLabs a aussi générée.

weekendchallengedevchallengegoogleai
FlakeWarden : 90,7 % de précision et 0 % de faux positifs côté sécurité sur le triage des tests instables, sur UiPath Maestro
Juin 2026
Lauréat
11 min de lecture

FlakeWarden : 90,7 % de précision et 0 % de faux positifs côté sécurité sur le triage des tests instables, sur UiPath Maestro

Les tests instables sont le mode d'échec le plus corrosif en CI : un build rouge peut être une vraie régression ou juste du bruit, et les ingénieurs finissent par ignorer les builds rouges jusqu'à ce qu'un vrai bug parte en prod. FlakeWarden répond à la seule question qui compte (vrai défaut, instable, ou environnement) avec un scoreur d'instabilité déterministe pour les cas clairs et un classifieur UiPath Agent Builder ancré pour les cas ambigus, orchestré par Maestro avec un humain qui valide chaque changement. 90,7 % de précision sur un corpus de 150 cas, avec un taux de faux positifs côté sécurité de 0 % tenu par mécanisme.

AgentHackUiPathUiPath Maestro
LotZero : zéro ventes en trop et zéro doubles débits sur une enchère mondiale en direct, prouvé sur Aurora DSQL
Juin 2026
10 min de lecture

LotZero : zéro ventes en trop et zéro doubles débits sur une enchère mondiale en direct, prouvé sur Aurora DSQL

Le commerce mondial en direct imposait un choix : une base SQL mono-région (juste mais lente pour les enchérisseurs lointains) ou un stockage multi-régions à cohérence éventuelle (rapide mais dangereux pour l'argent). Aurora DSQL fait tomber ce compromis. LotZero pose le registre d'argent sur DSQL et le flux social sur DynamoDB, puis prouve l'invariant avec une console de contention qui déclenche des centaines de réclamations mondiales concurrentes et mesure : zéro ventes en trop, zéro doubles débits.

H0HackathonAmazon Aurora DSQLAmazon DynamoDB
OrbitOnboard : j'ai utilisé les quatre types de requêtes GitLab Orbit pour générer un kit de démarrage en 10 secondes
Juin 2026
11 min de lecture

OrbitOnboard : j'ai utilisé les quatre types de requêtes GitLab Orbit pour générer un kit de démarrage en 10 secondes

La moitié des nouveaux contributeurs abandonnent leur première tentative dans une base de code inconnue. Pas parce que le problème est trop dur, mais parce que la carte n'existe pas. OrbitOnboard produit cette carte en exploitant les quatre types de requêtes Orbit dans un seul flux coordonné : fichiers critiques, ordre de lecture, carte des experts, MR passées similaires, issues ouvertes liées, postés directement en commentaire d'issue.

GitLab OrbitKnowledge GraphDeveloper Experience
SWORN : j'ai bâti une passerelle DFIR qui signe cryptographiquement chaque finding
Juin 2026
13 min de lecture

SWORN : j'ai bâti une passerelle DFIR qui signe cryptographiquement chaque finding

Les concurrents loggent. SWORN prouve. Une passerelle MCP personnalisée pour Protocol SIFT où chaque finding DRAFT porte une signature Ed25519 sur les IDs d'invocation d'outil, les hash SHA-256 de stdout/stderr, les codes de sortie et les vecteurs d'arguments. La clé de signature est détenue par la passerelle, pas par le LLM. Un finding sans chaîne de signature valide ne peut pas quitter l'état DRAFT.

DFIRMCPSANS SIFT
AgentGate : j'ai construit la porte entre les agents IA et Splunk
Juin 2026
13 min de lecture

AgentGate : j'ai construit la porte entre les agents IA et Splunk

Splunk a livré six capacités agentic en douze mois. Chacune peut lire vos données, proposer des changements et, de plus en plus, les exécuter. Aucune ne répond à la question que pose la conformité : qui a approuvé cette action et quel était son rayon d'impact ? AgentGate est la porte pré-action qui produit un journal d'audit défendable pour chaque décision d'agent IA contre Splunk.

SplunkSplunk MCPFoundation-Sec
Warden : j'ai construit un agent qui gouverne vos autres agents
Juin 2026
12 min de lecture

Warden : j'ai construit un agent qui gouverne vos autres agents

Une fois qu'on a une flotte d'agents IA qui agissent sur de vrais systèmes (approbation de remboursements, changement de prix, déplacement d'inventaire), qui les surveille quand l'un d'eux dérape ? Warden est le superviseur que j'ai construit pour le Google Cloud Rapid Agent Hackathon : MCP Dynatrace pour les sens, Gemini 3 pour le jugement, une vraie porte d'approbation humaine et une comptabilité en dollars honnête pour chaque incident.

Gemini 3Vertex AIADK
Appetite for Noise : j'ai testé le récit Ozempic sur les données nationales
Mai 2026
10 min de lecture

Appetite for Noise : j'ai testé le récit Ozempic sur les données nationales

Le PDG de Walmart, Morgan Stanley et une série de notes d'analystes affirment que les GLP-1 font déjà plier les dépenses américaines en restaurants, alcool et épicerie. Le test naïf avant/après sur les données FRED donne une réponse confiante, significative, et fausse en direction. Voici ce qui survit à une inférence correcte et à un vrai contrôle de tendance, et la vraie taille de l'effet.

Difference-in-DifferencesEconometricsFRED
Cinq outils MCP qui voient une grossesse comme une seule unité clinique
Avr. 2026 à Mai 2026
Lauréat
10 min de lecture

Cinq outils MCP qui voient une grossesse comme une seule unité clinique

Lauréat d'Agents Assemble : The Healthcare AI Endgame de Prompt Opinion, parmi 4 335 participants. La mortalité maternelle aux États-Unis ne cesse d'augmenter et plus de 80 % des décès liés à la grossesse sont évitables, mais les signaux prédictifs vivent dans des parties complètement différentes du dossier. J'ai construit un serveur MCP qui les agrège, et un agent de triage qui lui délègue.

FHIRMCPHealthcare
Pourquoi j'ai bâti un classificateur d'exoplanètes qui dit « Je ne sais pas »
Oct. 2025
5 min de lecture

Pourquoi j'ai bâti un classificateur d'exoplanètes qui dit « Je ne sais pas »

Un classificateur XGBoost sur les données NASA Kepler, K2 et TESS, c'est un samedi après-midi. La partie intéressante, c'est tout ce qu'il y a autour : trois vraies classes (CONFIRMED, CANDIDATE, FALSE POSITIVE) plus un bac UNKNOWN d'abstention, téléversement de jeux de données, réentraînement dans le navigateur avec réglage des hyperparamètres, exploration 2D et vues 3D des systèmes.

XGBoostNASAThree.js