秘塔ai搜索需用href提取知乎链接再解析源码标题:先执行js获取所有知乎url,再逐个打开提取json中title字段,用正则re.findall匹配跨行含转义的"title":"xxx"结构,最后utf-8保存为纯标题列表。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你想把秘塔AI搜索“知乎提示词工程问题”得到的原始结果,快速整理成可直接导入Excel或石墨知识库的纯标题列表,每行一个、不加编号、不带标点、无空行——但秘塔页面默认渲染会把多个标题挤在同一个
剥离秘塔AI搜索页的干扰信息
打开秘塔AI搜索 → 输入“知乎 提示词工程 问题” → 点击搜索 → 滚动页面到底部确保所有结果加载完成(秘塔有懒加载,没滚到底=漏掉30%以上真实提问)→ 按F12打开开发者工具 → 切换到Console标签页。
粘贴并执行以下代码:
Array.from(document.querySelectorAll('a[href*="zhihu.com/question/"], a[href*="zhihu.com/answer/"]')).map(el => el.href).filter(u => u).join('\n')
这一步不能跳过。【必须用href属性提取,而非data-url或text】,因为秘塔部分卡片的data-url是跳转代理链接,点开会404;而innerText会混入“相关话题”“热榜推荐”等非用户提问内容,污染率超50%。
批量提取知乎原问题标题
把上一步复制出的所有知乎链接,逐个粘贴进新浏览器标签页打开 → 每打开一个页面,按Ctrl+U查看源码 → Ctrl+F搜索"title":"(英文双引号+冒号)→ 找到形如"title":"如何系统学习提示词工程?"的JSON字段 → 复制冒号后、结尾双引号前的纯文本 → 换行粘贴到记事本中。
注意:如果某条标题含内部引号(如"title":"他说'提示词要像函数一样写',对吗?"),需手动删掉最外层双引号及其中的转义字符\,只保留中文问题本身。否则后续正则会断裂。
用正则清洗并强制分行
方法一:VS Code一键提纯
把所有原始标题存为raw.txt → 在VS Code中打开 → Ctrl+H调出替换面板 → 勾选“使用正则表达式” → 查找:"([^"]+)" → 替换为:$1 → 全部替换。
方法二:应对含换行与反斜杠的脏数据
新建clean.py,粘贴以下代码:
import re<br>with open('raw.txt', 'r', encoding='utf-8') as f:<br> text = f.read()<br>titles = re.findall(r'"title"\s*:\s*"([^"]+)"', text)<br>for t in titles:<br> if t.strip():<br> print(t.strip())
保存后双击运行,命令行窗口会逐行输出干净标题。
这一步的关键是【必须用re.findall匹配JSON字段,而非简单按换行切分】,因为秘塔返回的源码中,标题JSON常跨多行,且含\n\t等不可见字符,用split('\n')会把一个标题切成三段。
导出为UTF-8编码TXT文件
第一步:执行Python脚本或VS Code替换后,全选控制台或编辑器中的输出内容 → Ctrl+C复制。
第二步:新建记事本 → Ctrl+V粘贴 → Ctrl+S保存。
第三步:文件名输入“提示词工程标题库.txt”,点击“保存”按钮旁的下拉箭头 → 选择“另存为” → 编码选【UTF-8】 → 确认保存。
如果保存时误选ANSI,中文标题会出现“鎻浠ょ”类乱码;石墨知识库导入时会直接报错,无法解析。











