把 YouTube 视频变成可以查询的知识库
视频是极好的学习格式,却是极糟的查阅格式——信息就在那里,但被锁在一条时间轴后面。把口述内容做成索引,就把一个播放列表变成了可以提问的东西,而且答案会带回它出自视频哪一处的引用。需要提前规划的那个坑是:字幕记录的是说过的话,不是展示过的东西。
把视频当参考资料的麻烦
你三月看过一场三小时的会议演讲。到了八月,你记得有人就失败率讲过一个很具体的观点,而你现在需要它。你的选择是:拖时间轴、指望章节标记做得靠谱,或者重看一遍。
而同样的信息若在 PDF 里,八秒钟就能找到。视频的弱点不在内容——在于没有随机访问。把口述内容做成索引,就把它还了回来。
它是怎么运作的
- 把视频或 YouTube 链接添加为来源。
- 口述内容被转成文字,并按处理文档的同一方式建立索引。
- 你用平常的话提问。
- 答案带着「它出自视频哪一处」的引用回来——于是你可以直接跳过去核对。
这意味着有用的单位不再是「一段视频」,而变成了「某人提出的一个说法」,而后者才是你真正想要的。
字幕真正遗漏的东西
这是诚实的局限,也决定了这套做法适不适合你手上的材料:
- 屏幕上的代码,如果讲者没有念出来。编程教程是最糟的情况——实质内容常常完全是视觉的。
- 图表和示意图。「大家可以看到这里」这句话,转成文字之后不含任何信息。
- 无声的演示。凡是讲者停下不说话、直接动手做的部分。
- 屏幕上的文字——幻灯片标题、字幕条、注释——只要从未被念出来。
所以:演讲、访谈、课堂、播客和解说,索引效果极好。屏幕录制的教程只能部分索引。要清楚你手上是哪一种;如果有幻灯片,把它作为单独来源一并加进去。
给一个视频知识库划定范围
| 集合 | 之所以管用 |
|---|---|
| 一场会议的一个分会场 | 主题一致、讲者多位——比较类的问题变得可能 |
| 一门课或一个系列讲座 | 内容是累积的;「这是在哪里引入的?」有答案 |
| 一个创作者的一个主题 | 术语一致,因此检索很准 |
| 对同一个人的多次访谈 | 「他的立场变了吗?」——跨越数年 |
| 你看过的所有东西 | 不管用——稀释会让每一个答案都变差 |
值得问的那些问题
一旦一组演讲变得可以查询,有意思的问题就不是查找,而是那些以前根本不现实的问题:
- 「关于 X,哪些讲者意见相左,各自到底说了什么?」
- 「把这六个视频里提到 Y 的地方全部总结出来,带时间戳。」
- 「他们在 2024 年那场演讲里主张了什么,而在 2026 年那场里没有再提?」
- 「把讲到的实际步骤给我,理论部分略过。」
最后一个是日常的大赢家。多数演讲是 20% 可执行内容加 80% 背景,而只要那 20%,是对你本来会花在重看上的四十分钟的正当使用。
把文档也混进来
最强的版本不是只有视频。一门课是讲座加上阅读材料加上你的笔记;一个研究课题是会议演讲加上它们背后的论文。把它们一起索引,一个问题就会由真正含有答案的那个来源来回答——而不是由你去猜该先搜哪一个。
和一整个 PDF 文件夹的搭法一样,规矩也一样:在依赖它之前,先用你已经知道答案的问题试一遍。
常见问题
AI 能在 YouTube 视频里面搜索吗?
能,通过口述内容——转成文字、建立索引,并在回答时附上「答案出自视频哪一处」的引用。
字幕会遗漏什么?
一切视觉的东西:幻灯片上的代码、图表、无声演示、从没被念出来的屏幕文字。
一个知识库里放多少视频?
足以覆盖一个主题就好——一个分会场、一门课、某个创作者的一个系列。混入不相干的频道会稀释检索。
可以把视频和文档混在一起吗?
可以,而且通常这正是重点。一个问题,由持有答案的那个来源来回答。