Alle Projekte

Selbst hostbares Open-Source-ZweitgehirnOpen SourceOpen Source

OpenBrain

Erfassen Sie Reels, Beiträge, Links und Screenshots, die Sie speichern. OpenBrain liest und fasst sie zusammen und lässt Sie in normaler Sprache danach suchen.

Screenshot der Oberfläche von OpenBrain

Ergebnis

Suche in normaler Sprache über alles Gespeicherte

Das Problem

Alles, was man speichert, landet an einem Ort, an dem man nie wieder nachsieht. Lesezeichen, gespeicherte Reels, Screenshots: alles davon ist reiner Schreibzugriff.

Was ich gebaut habe

Gebaut wurde eine Ingest-Pipeline, die jedes Element beim Eintreffen liest, Text per OCR aus Screenshots und Transkripte aus Videos zieht und das Ergebnis einbettet, sodass es nach Bedeutung durchsuchbar wird.

Das Ergebnis

Man kann nach dem fragen, woran man sich nur halb erinnert, und bekommt es tatsächlich zurück. Selbst hostbar, damit das Archiv einem selbst gehört.

So funktioniert es

  1. 01

    Ein Element wird gespeichert: ein Link, ein Screenshot, ein Reel, ein Beitrag.

  2. 02

    Es wird beim Hineingehen gelesen, nicht beim Herausholen: OCR für Bilder, Transkription für Video, Extraktion für Seiten.

  3. 03

    Der extrahierte Text wird zusammengefasst und eingebettet, sodass das Element danach durchsuchbar ist, worum es ging, und nicht nach seinem Dateinamen.

  4. 04

    Das Retrieval beantwortet eine halb erinnerte Beschreibung, statt die exakten enthaltenen Worte zu verlangen.

Die KI-Schicht

OCR und Transkription beim Ingest, Zusammenfassung für einen lesbaren Eintrag und Embeddings für die bedeutungsbasierte Suche. Das teure Lesen einmal beim Schreiben zu erledigen ist das, was die Suche beim Lesen billig macht.

Die Engineering-Schicht

Eine Ingest-Warteschlange, die das Element überlebt, das sie nicht parsen kann, ein Vektorspeicher und eine Deployment-Form, die einfach genug ist, dass Selbsthosting realistisch statt theoretisch ist.

Zentrale technische Entscheidungen

Beim Ingest lesen, nicht zur Abfragezeit.

Die Verarbeitung beim Hineingehen kostet einmal mehr und macht jede spätere Suche schnell. Die Verarbeitung beim Herausholen bedeutet, dass jede Abfrage die OCR erneut bezahlt.

Selbst hostbar, wegen dessen, was Menschen speichern.

Ein persönliches Archiv ist das Letzte, worum man jemanden bitten sollte, es einem Dritten zu übergeben. Selbsthosting ist das Feature, keine Deployment-Option.

Gebaut mit

Next.jsVector DBLLMOCR

Verwandt