Tous les projets

Second cerveau open source auto-hébergeableOpen SourceOpen source

OpenBrain

Capturez les reels, publications, liens et captures d'écran que vous enregistrez. OpenBrain les lit, les résume et vous laisse les retrouver en langage courant.

Capture de l'interface de OpenBrain

Résultat

Recherche en langage courant sur tout ce qui est enregistré

Le problème

Tout ce que l'on enregistre finit dans un endroit où l'on ne retournera jamais. Favoris, reels sauvegardés, captures d'écran : tout cela est en écriture seule.

Ce que j'ai construit

Un pipeline d'ingestion qui lit chaque élément à l'entrée, extrait le texte des captures par OCR et les transcriptions des vidéos, puis vectorise le résultat pour le rendre cherchable par le sens.

Le résultat

On peut demander la chose dont on se souvient à moitié avoir enregistrée et la récupérer vraiment. Auto-hébergeable, pour que l'archive reste la vôtre.

Comment ça marche

  1. 01

    Un élément est enregistré : un lien, une capture, un reel, une publication.

  2. 02

    Il est lu à l'entrée et non à la sortie : OCR pour les images, transcription pour la vidéo, extraction pour les pages.

  3. 03

    Le texte extrait est résumé et vectorisé, pour que l'élément soit cherchable par son sujet plutôt que par son nom de fichier.

  4. 04

    La recherche répond à une description à moitié souvenue au lieu d'exiger les mots exacts qu'elle contenait.

La couche IA

OCR et transcription à l'ingestion, résumé pour une trace lisible, et plongements pour la recherche par le sens. Faire la lecture coûteuse une fois à l'écriture est ce qui rend la recherche bon marché à la lecture.

La couche ingénierie

Une file d'ingestion qui survit à l'élément qu'elle ne sait pas analyser, un magasin vectoriel, et une forme de déploiement assez simple pour que l'auto-hébergement soit réaliste plutôt que théorique.

Décisions techniques clés

Lire à l'ingestion, pas au moment de la requête.

Traiter à l'entrée coûte plus cher une fois et rend chaque recherche ultérieure rapide. Traiter à la sortie signifie que chaque requête repaie l'OCR.

Auto-hébergeable, à cause de ce que les gens enregistrent.

Une archive personnelle est la dernière chose que l'on devrait demander à quelqu'un de confier à un tiers. L'auto-hébergement est la fonctionnalité, pas une option de déploiement.

Construit avec

Next.jsVector DBLLMOCR

Sur le même sujet