为 Agent 构建记忆层:统一分散的多模态资产
数百个演讲跨多年,每个都有元数据、转录、演讲者信息、PDF/PPT 和视频——但没有一个好用的方式把它们搜出来。
核心要点
- 真实的数据挑战:不是「数据不够」,而是数据散落在多种模态里,相互之间没有关联。
- 目标是跨模态检索:能从演讲视频里找到某句话,也能从 PDF 里找到对应的图。
- 平台:Google Colab(CPU 或 T4 GPU 都能跑)。
- 存储:ApertureDB。
◇ 对你的项目意味着什么
多模态检索的难点不在模型,在统一索引。先把元数据、文本、向量放同一个库里,再谈检索效果。