可自托管的开源第二大脑开源开源
OpenBrain
收录你保存的短视频、帖子、链接和截图。OpenBrain 会读取它们、生成摘要,并让你用大白话把它们找回来。

结果
用大白话检索所有保存过的内容
问题
你保存的一切最后都进了一个再也不会去看的地方。书签、收藏的短视频、截图,全都是只写不读。
我构建了什么
构建了一条在入库时就读取每条内容的流水线,用 OCR 从截图里取文字、从视频里取转写,再把结果做向量化,从而可以按语义检索。
成效
你可以描述一个只记得半截的东西,然后真的把它找回来。可自托管,档案始终是你自己的。
工作原理
- 01
一条内容被保存:一个链接、一张截图、一条短视频、一个帖子。
- 02
在进来的时候读,而不是在取出的时候读:图片用 OCR,视频做转写,网页做抽取。
- 03
抽出的文字被摘要并向量化,因此这条内容可以按它讲了什么来找,而不是按文件名。
- 04
检索回应的是记了一半的描述,而不是要求你说出其中的原话。
AI 层
入库时做 OCR 与转写,用摘要留下可读的记录,用向量嵌入支持语义检索。把昂贵的阅读在写入时做一次,正是让读取时的检索变便宜的原因。
工程层
一条能扛住解析失败条目的入库队列、一个向量库,以及一套简单到让自托管切实可行而非纸上谈兵的部署形态。
关键技术决策
在入库时读,而不是在查询时读。
在写入时处理只贵这一次,之后每次检索都快。在取出时处理,意味着每次查询都要重付一遍 OCR 的钱。
考虑到人们会保存什么,就该自托管。
个人档案是最不该请人交给第三方的东西。自托管在这里是功能本身,不是一个部署选项。
技术构成
Next.jsVector DBLLMOCR