需先提取知乎直答搜索“ai编程入门”的原始json问题文本,再用正则清洗出纯问题,最后按平台关键词批量分类打标并生成带前缀的标准标题。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你想在知乎直答搜索“AI编程入门”相关问题,但结果混杂着Python、JavaScript、Scratch、TensorFlow、PyTorch甚至低代码平台的内容,需要快速按平台归类并生成规范标题,方便后续整理成知识图谱或学习路径文档。
提取知乎直答搜索页的原始问题列表
打开知乎直答,输入“AI编程入门”,点击搜索→滚动到底部加载全部结果→右键页面空白处→选择“查看网页源代码”→按 Ctrl+F 搜索关键词 【"text":"】(注意引号和冒号是英文标点),定位到包含用户提问文本的 JSON 片段→复制所有匹配行→粘贴到记事本中。
这一步必须做,否则后续无法识别真实提问语义;直接截图OCR或手动抄写会漏掉长尾问题且无法批量处理。
用正则清洗出纯问题文本
在 VS Code 或 Notepad++ 中打开刚保存的文本文件→启用正则模式→查找:"text":"([^"]+)"→替换为:$1\n→执行全部替换。
注意:如果出现乱码或换行错乱,说明原始 JSON 中有未转义的双引号或换行符,此时需先用 Python 脚本 load JSON 再 dump 出纯 text 列表,不能硬切。
按平台关键词分类打标
方法一:人工快速扫描法(适合问题数<50)
新建 Excel 表格,A列粘贴问题文本,B列手填平台名。遇到含“Python”“PyTorch”“TensorFlow”“Keras”“Jupyter”的归为【Python生态】;含“JavaScript”“Three.js”“p5.js”“WebAI”归为【Web前端】;含“Scratch”“Blockly”“米思齐”归为【图形化编程】;含“AutoGen”“LangChain”“LlamaIndex”优先标【Agent开发】而非“Python”。
方法二:命令行批量打标(推荐,50+问题必用)
保存问题文本为 questions.txt → 打开终端 → 运行:grep -i "python\|pytorch\|tensorflow\|jupyter" questions.txt | sed 's/^/[Python]/' > python_q.txtgrep -i "javascript\|p5\.js\|three\.js\|webai" questions.txt | sed 's/^/[Web]/' > web_q.txtgrep -i "scratch\|blockly\|mixly" questions.txt | sed 's/^/[图形化]/' > visual_q.txt
grep 命令中的反斜杠 \. 是必须的,否则 p5.js 会被当成 p5js 匹配,漏掉关键问题。
生成带平台前缀的标准标题
第一步:合并各平台文件 → cat python_q.txt web_q.txt visual_q.txt > all_tagged.txt
第二步:去除重复行 → sort -u all_tagged.txt > unique_titles.txt
第三步:补全标题格式 → 用 sed 添加末尾问号并统一空格:sed 's/?$/?/; s/?$/?/; s/ $//; s/?/? /' unique_titles.txt | sed 's/\[.*\]/& /' > final_titles.txt
这一步不能跳过空格清理,否则导出到 Markdown 时会出现缩进错乱或列表解析失败。











