codegeex支持五种python爬虫生成方式:一、单次提示生成完整链家爬虫;二、分步提示构建动态分页爬虫;三、翻译模式复用js爬虫逻辑;四、隐匿模式补全解析组件;五、交互模式调试xpath/css选择器。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您希望快速生成网络爬虫代码,但对 requests、BeautifulSoup 等库的组合调用不熟悉,CodeGeeX 可基于自然语言描述直接输出可运行的 Python 爬虫脚本。以下是多种实现方式:
一、使用单次提示生成完整链家房价爬虫
该方法适用于目标网站结构稳定、页面 URL 规律明确的场景,CodeGeeX 可一次性生成含请求头设置、HTML 解析、分页构造与数据提取的完整脚本。
1、打开 CodeGeeX 官网 https://codegeex.cn/ 或在已安装插件的 IDE 中激活交互模式。
2、在输入框中键入:“使用Python编写爬虫抓取链家杭州余杭区二手房标题和价格,要求处理User-Agent、解析div.info clear结构、并打印结果”。
3、点击生成,获取包含 requests.get()、BeautifulSoup 解析、find_all() 提取及 print 输出的完整代码段。
4、复制代码至本地 .py 文件,确认已安装 requests 与 beautifulsoup4 库后直接运行。
二、分步提示构建动态分页爬虫
该方法适用于需自动推导多页 URL 规律的场景,通过拆解任务为“解析规律→生成循环→合并解析”,提升生成代码的准确性与可控性。
1、首次提问:“分析以下URL规律并输出从第1页到第100页的全部URL:https://hz.lianjia.com/ershoufang/yuhang/、https://hz.lianjia.com/ershoufang/yuhang/pg2/、https://hz.lianjia.com/ershoufang/yuhang/pg3/”。
2、获得规律后,第二次提问:“用Python for循环生成这100个URL,并对每个URL发起requests请求,使用BeautifulSoup提取标题和价格,要求跳过异常响应”。
3、将两次生成的代码片段整合,补充 time.sleep(1) 避免请求过频。
4、在代码开头添加 import requests, time, re, os 和 from bs4 import BeautifulSoup。
三、利用翻译模式复用已有爬虫逻辑
该方法适用于已有其他语言编写的爬虫(如 JavaScript Puppeteer 脚本),需快速转为 Python 实现,CodeGeeX 的翻译功能可保留核心逻辑结构。
1、复制一段已有的 Node.js 爬虫代码,例如使用 axios + cheerio 抓取标题的片段。
2、在 CodeGeeX 编辑器中选中该代码,按下 Ctrl+Alt+T 激活翻译模式。
3、在弹出选项中选择目标语言为 Python,并指定依赖库为 requests + BeautifulSoup。
4、确认生成结果中已替换 selector 语法(如 cheerio('h1') → soup.find('h1'))、响应处理逻辑(如 response.data → response.text)。
四、结合隐匿模式补全局部爬虫组件
该方法适用于已有部分代码(如已写好 requests 请求模块),仅需智能补全解析或清洗逻辑,减少重复输入。
1、在 IDE 中新建 Python 文件,手动输入基础请求块:
url = "https://example.com"
headers = {"User-Agent": "Mozilla/5.0"}
response = requests.get(url, headers=headers)
2、光标置于 response 后换行,保持空行,触发 CodeGeeX 隐匿模式自动联想。
3、等待右侧出现多个建议,按 Alt + ↓ 切换至含 BeautifulSoup 解析的建议项。
4、按 Tab 插入推荐代码,检查是否包含 soup = BeautifulSoup(response.text, 'html.parser') 及对应 find() 调用。
五、通过交互模式调试 XPath/CSS 选择器
该方法适用于目标网页结构复杂、class 名动态变化时,需实时验证选择器有效性,CodeGeeX 可根据 HTML 片段反推可靠定位表达式。
1、从浏览器开发者工具中复制一段含目标数据的 HTML 片段,例如:
2、在 CodeGeeX 交互界面(Ctrl+Enter 唤出)中粘贴该 HTML,并输入提示:“写出能准确提取‘新湖果岭’文本的 BeautifulSoup CSS 选择器和对应Python代码”。
3、查看返回结果中是否包含 soup.select_one('div.title a').text 或 soup.find('div', class_='title').find('a').text。
4、将验证通过的选择器替换进主爬虫的解析段落。











