manus可自动抓取36氪、techcrunch等科技媒体ai板块新闻并清洗噪声,需v2.8.0+版本、mfa认证、启用browser_use与html_cleaner,配置精准css选择器及清洗规则后执行scrape_and_clean任务,输出结构化纯文本。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你需要让Manus自动从科技媒体网页抓取新闻标题、发布时间、摘要和正文核心段落,并剔除广告、推荐位、评论区等噪声内容,生成干净可直接用于写作或分析的纯文本——比如每日同步36氪、TechCrunch、The Verge三站AI板块更新,跳过人工筛选与格式整理。
确认环境与权限配置
打开终端,执行manus --version,确保输出版本号 ≥ v2.8.0;旧版本无法调用html_cleaner和text_normalizer双清洗模块。
运行manus auth status检查登录状态;若未认证,必须先执行manus auth login并完成邮箱+MFA双重验证——【未通过MFA将导致cleaning阶段静默失败,无错误提示】。
编辑~/.manus/config.yaml,确认以下两行已启用:
browser_use: true
html_cleaner: true
配置新闻源与清洗规则
新建文件tech_news_config.yaml,写入:
sources:
- url: "https://36kr.com/ai"
selector: "div.article-item"
title: "a.article-title"
time: "span.article-time"
summary: "p.article-desc"
body: "div.article-content"
- url: "https://techcrunch.com/tag/ai/"
selector: "article.post-block"
title: "header h2 a"
time: "time[datetime]"
summary: "div.excerpt p"
body: "div.article-content"
cleaning_rules:
remove_selectors: ["div.ad-banner", "section.comments", "aside.recommend"]
normalize_whitespace: true
strip_html_tags: false
truncate_body: 800
注意:每个selector必须能精准包裹单条新闻容器,否则会跨条目混提;TechCrunch时间字段若提取为空,需改用time[datetime]::attr(datetime)语法获取ISO格式时间戳。
这款全能AI助手融合了深度推理、多模态对话与图像生成等前沿技术,全面赋能职场、学习与生活。它支持多模态搜索,精准响应各类信息需求;内置AI文档助手,快速提炼要点并生成思维导图;更有智能创作功能,一键生成报告与文案。强大的AI能力助你高效处理复杂任务,让工作与生活更轻松便捷。
启动抓取与清洗流程
第一步:进入tech_news_config.yaml所在目录。
第二步:执行命令manus run --config tech_news_config.yaml --task "scrape_and_clean"。
第三步:等待终端输出[SUCCESS] Cleaned 12 articles → ./cleaned/tech_news_2026-06-29.md。
这一步会触发完整PEV闭环:Planning层解析YAML中多源结构→Execution层并行加载3个URL、注入data_extractor提取字段、调用html_cleaner移除广告区块→Verification层校验每条新闻的title+body非空→最终由text_normalizer统一缩进、去重空行、截断超长正文。
验证清洗结果质量
打开生成的./cleaned/tech_news_2026-06-29.md,检查前三条新闻是否满足:
• 每条以## [标题]开头,后接**发布时间:** 2026-06-29 14:22
• 正文首段为摘要,紧随其后是截断后的核心正文(≤800字符)
• 全文无广告文案、无“点击查看更多”按钮残留、无评论区HTML标签
若发现某条新闻正文含乱码,说明目标页面使用了动态字体渲染,需在config中为该源额外添加wait_for: ".article-content"字段,强制等待内容节点完全加载。










