skywork agent 不直接联网采集数据,而是通过本地文件导入、专用工具解析、自然语言指令驱动,实现已有数据的自动化整理与结构化归档,全程可控、可验、闭环。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

Skywork Agent 本身不直接联网爬取网页或对接数据库,它不提供通用型“数据采集”能力,而是聚焦于已有数据的自动化整理与结构化处理。所谓“采集”,在 Skywork 场景中,实际是指:把散落在本地、邮件、PDF、Excel、截图等载体中的原始信息,先提取出来,再统一清洗、归类、命名、归档。整个过程强调可控、可验、本地闭环。
明确数据来源,先“收进来”再处理
Agent 无法主动监听邮箱或抓取网页,所以第一步是把目标数据以文件形式落到本地: - 邮件附件(如采购单PDF、周报Excel)→ 手动保存到指定文件夹,或用 Outlook 规则自动归档 - 网页内容(如政策原文、产品更新日志)→ 用浏览器“另存为HTML”或截图后OCR转文本 - 会议录音 → 先用讯飞听见/腾讯云ASR转成文字,删掉口语冗余,存为 .txt - ERP/CRM导出报表 → 每次导出后统一存入「/data/incoming/」目录,并按日期命名推荐建立一个固定入口路径,比如 D:\skywork\inbox,所有待处理数据都先放这里。Agent 后续只认这个位置,不关心数据怎么来的。
用工具链分步提取,不依赖模型硬猜
面对不同格式,靠专用工具解析,再交由 Agent 做语义操作: - PDF 表单/扫描件 → 先用 xParse 或 pdfplumber 解析出 JSON/CSV,再喂给 Agent 清洗脱敏 - Excel 订单表 → Agent 可直接读取,指令如:“把 Sheet1 中‘客户名’列去空格、去重,生成新表并按‘区域’分组统计数量” - 多页合同文本 → 指令:“识别所有含‘甲方’‘乙方’‘违约金’的段落,提取前后各2句,合并为 summary.txt” - 截图类凭证 → 先用内置 OCR Skill 提取文字,再用“关键词定位”Skill 找出金额、日期、单号等字段关键点:提取动作由确定性工具完成,Agent 负责调度和后续规则执行,避免让大模型直接面对原始杂乱文本。
自然语言驱动整理与归档
数据结构化后,用一句话触发批量动作: - “把 D:\skywork\inbox 里所有 2026 年发票 PDF,按开票方名称建文件夹,重命名为‘开票方_金额_日期.pdf’,移入 D:\archive\invoices\2026” - “扫描 D:\skywork\inbox\orders 下全部 Excel,提取‘SKU’‘数量’‘交付日期’三列,合并为 orders_summary_20260616.xlsx,存到 D:\report” - “将 D:\skywork\inbox\meeting 中所有 txt 文件,按‘完成’‘阻塞’‘待办’三类打标签,分别归入对应子文件夹,并生成本周汇总清单(Markdown)”所有操作均在本地完成,不上传原始文件;移动、重命名、生成新文件等动作实时可见,失败项自动记录在历史日志中。
设置定期归集+异常反馈机制
- 在「自动化中心」配置定时任务:每天上午9点自动扫描 inbox 目录,执行预设整理流程 - 对无标准格式的文件(如手写便签拍照),启用“人工复核队列”:Agent 自动移到 /inbox/review/,并在通知栏提示“发现3份需确认的扫描件” - 每次执行后生成简要报告(含处理数、跳过数、错误项路径),可选发邮件或存为日志文件不追求全自动采集,但确保每一份进来的数据,都能被快速识别、稳定处理、清晰归档。











