Briefing produit
Un agent IA de veille défense & export-contrôle, cadré et construit comme un livrable réel — pipeline fonctionnel de bout en bout, pas une maquette.
Synthèse
Ce qui suit détaille le cadrage, l'architecture et les preuves — dans cet ordre.
Le problème
Non-objectif explicite : le système ne décide pas. Il accélère et structure la veille humaine — la décision reste humaine.
Cadrage
1 et 3 couverts en V1 · 2 livré en première tranche V2, sur les deux catégories les plus sensibles — l'extension aux trois autres est le prochain jalon (cf. feuille de route)
Périmètre MECE
Export control, contrats d'armement, mouvements militaires, diplomatie défense, programmes industriels — filtrage thématique, zone mondiale.
Renseignement classifié, cybersécurité (périmètre voisin distinct), décision automatisée, analyse financière de marché.
Révision assumée : un filtrage géographique strict, testé sur données réelles, rejetait à tort la quasi-totalité de 2 sources sur 5 → retiré, remplacé par une extraction de lieu en métadonnée non filtrante. Documenté comme révision, pas masqué.
Architecture
16 flux RSS, sélection par pays, validés en direct
collector.py
avant l'appel LLM, pas après
classification + résumé + citation vérifiée
recoupement + score de confiance, boucle d'outil bornée
État partagé (VeilleState) entre les nœuds, chaque nœud tracé nativement — sans instrumentation manuelle. Les trois premiers nœuds sont un workflow déterministe ; seul le vérificateur laisse le modèle décider de ses propres appels d'outil, sous double plafond.
Ce qui survit aux runs — budget LLM, liens vus, historique analysé — passe par une couche de persistance unique, fichiers locaux en développement et Firestore en production. Le digest servi est une fenêtre glissante sur cet historique, pas la photographie du dernier run : le dédoublonnage vidant les collectes suivantes, servir le run brut effacerait l'affichage à chaque passage.
Restitution
Score de confiance sur une rampe séquentielle et non en rouge/vert — un score lu comme un verdict invaliderait le non-objectif. Un item hors du périmètre du vérificateur sort sans score plutôt qu'avec un zéro. La provenance « média d'État » est affichée, pas noyée.
Couverture
Construite sur le lieu vérifié de l'événement, pas sur le pays de la source. Les items sans lieu extractible et les lieux non rattachables à un pays (espaces maritimes, commandements) sont comptés explicitement : une carte qui ne montrerait que ses succès surestimerait la couverture réelle.
Garde-fou non négociable
Chaque résumé généré par le LLM doit être accompagné d'une citation vérifiée verbatim contre le texte source. Sans preuve, l'item est rejeté automatiquement — pas seulement signalé.
Même principe appliqué au lieu extrait : vide plutôt que non vérifiable.
Valeur estimée
| Poste | Hypothèse | Valeur |
|---|---|---|
| Équipe concernée | 4 analystes dédiés | — |
| Gain de temps | 90 → 30 min de revue / jour / analyste | 528 h/an |
| Valeur temps | 528 h × 60 €/h chargé | ~32 000 €/an |
| Coût du système (mesuré réel) | ~200 items/j × 1 appel + escalade plafonnée | ~140 €/an |
Ratio favorable même en scénario dégradé (gain divisé par deux). Le bénéfice qualitatif — standardisation, traçabilité — reste déterminant au-delà du seul temps.
Risques
Citation verbatim obligatoire, rejet automatique si absente.
Positionnement explicite : aide à la veille, jamais outil de décision automatisée.
Sélection par pays sur critère SIPRI, médias d'État marqués comme tels dans le digest.
Plafond d'appels/jour + escalade agentique bornée — codés et testés, pas seulement documentés.
Preuve par l'usage · 1/2
Une mesure de précision teste autant la clarté des définitions que la qualité du modèle. Les deux s'auditent ensemble — la troisième mesure a fait ressortir la seule frontière de catégorie que le cadrage n'avait jamais spécifiée.
Preuve par l'usage · 2/2
Remonter du symptôme à la cause plutôt que corriger là où le problème se voit — et documenter ce qui reste non vérifié plutôt que de l'omettre. Aucun de ces défauts n'était visible en relecture de code.
Feuille de route
Recommandation : achever la couverture du vérificateur avant le déploiement — le score n'est produit que sur deux des cinq catégories. Le prérequis technique du déploiement est levé (état porté par une couche de persistance, Firestore en production), mais ce backend-là n'a pas encore tourné contre une base réelle.
En synthèse
MECE, alternatives évaluées, KPIs, risques, gouvernance — avec le même niveau d'exigence de vérification empirique du début à la fin, jusqu'à la mesure de précision finale.