先搜索,再选择性读取
建议用时:25 分钟(含练习)
学习目标
能够用文件名、关键词、链接与语义扩展定位相关材料,并控制读取范围。
本节产出
一份可复现的检索记录
核心知识:检索是逐步缩小问题范围
让 AI 使用资料,不等于让它一次读取整个资料库。先搜索、再选择性读取,可以减少无关内容,也让你解释为什么采用某些证据。检索不是只输入一个词等待答案,而是根据命中情况逐步修正查询,并保留选择与排除理由。
开始前先写清要回答的问题、时间范围、资料类型和允许读取的区域。例如“解释检索如何帮助构建上下文”与“比较本月三个检索产品的价格”需要不同来源。前者以概念与研究文档为主,后者需要当前官方价格信息,不能仅依靠旧笔记。
图中的筛选是逐步增加阅读深度:
- 文件名和标题:帮助定位。
- 命中片段:帮助判断相关性。
- 完整段落:帮助理解条件。
- 原始来源:帮助核实事实。
只读搜索摘要容易丢失限制,直接读全部内容又容易淹没重点。
案例:查找“上下文与检索”的材料
假设你有一组公开练习笔记,文件名不统一,有的用中文,有的用英文缩写。只搜索“上下文”可能漏掉 context,只搜索 RAG 又可能找到大量不相关产品介绍。因此先建立查询扩展表。
| 查询方向 | 示例词 | 解决的问题 |
|---|---|---|
| 核心概念 | 上下文、context | 找定义与基础说明 |
| 相关机制 | 检索、retrieval、RAG | 找资料选择过程 |
| 常见限制 | 截断、噪音、过期 | 找失败与边界 |
| 任务场景 | 问答、研究、引用 | 找可使用的案例 |
| 版本与时间 | 文档日期、更新记录 | 判断是否适用 |
这些词是本案例的起点,不是固定万能查询。看到某篇高相关资料使用新的术语时,可以把它加入下一轮检索;发现一个词持续命中无关主题时,可以增加范围限制或排除条件。
先看清单,再读正文
可以先用编辑器或 Obsidian 搜索查看标题与片段,再打开少量高相关笔记。熟悉命令行的人也可以在已经授权的练习目录中使用只读搜索工具。无论界面如何,流程都应保留查询词、范围、命中文件和选择理由。
读取命中段落时,向前后扩展一点上下文,确认代词指什么、结论是否有条件、引用是否来自另一篇资料。若笔记只是二手摘录,应继续回到原始公开页面核对。搜索工具找到的是文本匹配或相关性线索,不是事实正确性的证明。
没找到不等于不存在
搜索无结果可能来自词形不同、文件未被索引、扫描 PDF 无可搜索文本、资料在其他允许目录,或内容确实不存在。先检查这些可能,再决定是否扩大范围或补充公开研究。不要把一次查询失败写成“资料库没有任何相关内容”。
扩大范围也应有目的。一个研究任务不需要顺便读取无关财务、私人聊天或账号资料。若发现命中包含敏感信息,优先寻找公开替代材料或只保留必要的脱敏事实,不把原文整段送入外部服务。
什么时候停止搜索
可以用问题覆盖率判断:关键概念有定义、核心主张有证据、主要冲突有说明、实际例子能够复现。新增结果连续只重复已有信息时,可以暂时停止,并记录检索截止范围。对于仍没有证据的问题,保留未知,不靠增加不相关资料制造“研究充分”的印象。
动手练习
- 为案例写五组扩展词,并说明每组用途。
- 从十份虚构笔记中选择三份深入阅读,记录另外两份的排除理由。
- 模拟一次无结果查询,提出两种修正方式,并写出停止条件。
参考答案与推演
一个可复现记录应包含研究问题、允许范围、查询词、日期、命中项、选择理由和仍缺的证据。排除理由可以是只谈产品宣传、版本不适用或没有原始来源,而不能只写“感觉不好”。
无结果时可以加入英文同义词或检查文件是否有可搜索正文。停止条件可以是四个子问题均有可核实资料,剩余争议已标明。最终结论应说明“在本次检索范围内找到这些材料”,不把有限搜索夸大成对所有资料的穷尽调查。
完成检查
- 查询围绕具体问题,包含合理的同义词扩展。
- 选择与排除理由可以由他人理解。
- 关键片段读过上下文,并核对原始来源。
- 搜索范围受控,停止条件与未知项明确。
参考与来源
- Obsidian:Search:搜索界面与查询能力的官方说明。
- Anthropic:Effective context engineering for AI agents:理解按任务选择相关上下文的工程思路。
先搜索,再选择性读取
3 道题 · 及格分 60 分