Abdoulaye Diop.
Toutes les réalisations
Produit IAEn ligne

my-research-digest.com

Veille scientifique automatisée : recherche multi-sources, filtrage et classement des publications, puis synthèse par IA livrée chaque semaine.

my-research-digest.com

Contexte

Suivre la littérature de son domaine demande un temps que peu de chercheurs et d'équipes R&D peuvent y consacrer : le volume de publications croît bien plus vite que le temps disponible pour les lire.

my-research-digest automatise cette veille. À partir d'un sujet décrit en quelques lignes, le produit repère chaque semaine les publications récentes qui comptent et en restitue une synthèse lisible, livrée par e-mail.

La difficulté n'est pas de trouver des articles — les bases académiques en renvoient des milliers — mais de n'en garder que les bons. C'est là que se joue l'essentiel du travail, et c'est pourquoi la sélection passe par un enchaînement d'étapes plutôt que par une seule requête.

Mon rôle

Produit personnel, conçu et développé de bout en bout : chaîne de traitement, choix des modèles, back-end, interface, déploiement et exploitation.

Publié en open source sous licence MIT, code et documentation publics.

Approche technique

Chercher, filtrer, classer, synthétiser. Le produit élargit d'abord la recherche — plusieurs requêtes, deux bases — puis resserre en deux passes successives : la pertinence, puis la qualité. La rédaction ne vient qu'en dernier, sur ce qui a survécu.

Découper ainsi a un intérêt concret : chaque étape s'évalue séparément. Quand un numéro déçoit, on sait si le problème vient de ce qui a été cherché, de ce qui a été gardé ou de ce qui a été écrit — et on corrige là sans toucher au reste.

01

Requêtes

→ plusieurs angles

Un LLM reformule le sujet et sa description en plusieurs requêtes complémentaires, pour couvrir le thème sous des angles qu'une seule formulation manquerait.

02

Recherche

→ des milliers d'articles

Chaque requête est jouée sur Semantic Scholar et OpenAlex, deux bases académiques complémentaires, puis les résultats sont dédoublonnés par titre normalisé.

03

Filtrage

→ ce qui traite vraiment le sujet

Titre et résumé de chaque article passent devant un LLM qui joue le rôle de relecteur expert et écarte ce qui sort du sujet.

04

Classement

→ les mieux placés

Deux stratégies, paramétrables par veille : autorité des auteurs (log1p(citations) + h-index maximal), ou proximité sémantique (similarité cosinus entre l'embedding du résumé et la description du sujet).

05

Synthèse

→ un numéro

Les articles retenus sont analysés et résumés par LLM, compilés en numéro et envoyés par e-mail.

  • Une bibliothèque personnelle permet de mettre un article de côté et de le retrouver d'un numéro à l'autre.
  • Mise en pause automatique d'une veille après plusieurs numéros non lus, précédée d'un e-mail d'avertissement : inutile de produire — et de payer en tokens — du contenu que personne n'ouvre.
  • Deux back-ends séparés : une API produit en Node.js/Express sur MongoDB, et un service Python/FastAPI pour la génération, afin que la chaîne IA évolue à son rythme sans toucher au reste.

Résultats & impact

  • 50+ utilisateurs.
  • 800+ digests générés.
  • 3 000+ publications identifiées.
  • Code source public, sous licence MIT. Voir
Stack
LLMEmbeddingsFastAPINode.jsMongoDBReact
PrécédentChatbots no-code pour les services publicsSuivantchatbotmaker.fr

Un processus qui vous coûte trop de temps ?

Trente minutes en visio, gratuitement : on regarde s'il y a un cas d'usage exploitable, et par où commencer.