
本文介绍如何通过无头浏览器工具(如 puppeteer 或 playwright)自动化抓取嵌入在 iframe 中的动画视频直链,并批量下载,避免手动逐个查找 network 请求的繁琐操作。
本文介绍如何通过无头浏览器工具(如 puppeteer 或 playwright)自动化抓取嵌入在 iframe 中的动画视频直链,并批量下载,避免手动逐个查找 network 请求的繁琐操作。
要实现从类似 https://www.php.cn/link/c60e7d24e22cb7c59788e690275ff4df 这样的动漫页面中批量下载所有集数的视频,核心思路是模拟真实用户行为 + 拦截网络请求 + 解析动态加载的播放源。整个流程可分为以下关键步骤:
1. 分析页面结构与播放逻辑
首先确认目标网站的播放器是否为 <iframe></iframe> 嵌入,且视频资源是否通过 XHR/Fetch 动态加载(你已通过 DevTools 的 Network 面板验证了这一点)。多数现代播放器(如 Video.js、DPlayer 或自定义 HLS/DASH 播放器)会在 iframe 加载后发起一个或多个 .m3u8、.mp4、.ts 或 JSON 接口请求。这些请求往往携带动态 token 或 referer 校验,因此直接静态解析 HTML 通常无效。
2. 使用无头浏览器自动化交互
推荐选用 Puppeteer(Node.js) 或 Playwright(多语言支持,更健壮):
- 启动浏览器实例(可配置
headless: true以静默运行); - 访问目标动漫主页,等待页面渲染完成;
- 定位并点击“第1集”按钮(或遍历所有集数链接),触发 iframe 加载;
- 监听 iframe 内部的网络请求(Playwright 支持
page.route()拦截,Puppeteer 可用page.on('response')+ 正则匹配 URL); - 筛选出视频资源类型(如
response.url().includes('.m3u8') || response.headers()['content-type']?.includes('video/'))。
3. 批量处理与下载
对每集执行上述流程:
- 提取所有集数的跳转链接(通常位于
@#@#@#@#@#@#@#@#@#@1类似结构中); - 循环访问每集页面 → 注入监听逻辑 → 捕获首个有效视频 URL(注意去重和超时控制);
- 将捕获的 URL 交由
curl、aria2c或 Node.js 的https.get()流式下载保存为本地文件(建议添加Referer和User-Agent头以绕过防盗链)。
示例代码片段(Playwright + Node.js)
import { chromium } from 'playwright';
const browser = await chromium.launch();
const page = await browser.newPage();
// 拦截视频请求
page.on('response', async (response) => {
const url = response.url();
if (url.endsWith('.m3u8') || url.match(/\.(mp4|mp3|ts)$/)) {
console.log('✅ Found video source:', url);
// 调用下载函数(需自行实现)
await downloadVideo(url, `episode_${epIndex}.mp4`);
}
});
await page.goto('https://animejoy.ru/.../friren1.html');
await page.click('text=Эпизод 1');
await page.waitForTimeout(3000); // 等待播放器加载并发起请求
注意事项
- ⚠️ 部分网站使用 Service Worker 或加密 manifest(如 AES-128 密钥分离),需额外解析 key URL;
- ⚠️ 频繁请求可能触发反爬(IP 封禁、验证码),建议添加随机延时、轮换 User-Agent,必要时使用代理池;
- ⚠️ 尊重网站
robots.txt及服务条款,仅用于个人离线学习,避免高并发下载影响服务器。
综上,这不是传统静态爬虫任务,而是基于浏览器自动化的行为驱动型数据获取——Puppeteer/Playwright 是当前最可靠的技术路径。掌握请求拦截、上下文切换与异常处理后,即可构建稳定、可扩展的批量下载工作流。











