codegeex支持四种网页html数据提取方式:一、生成beautifulsoup代码解析静态html;二、编写scrapy selector逻辑批量提取;三、构建正则表达式提取简单模式文本;四、生成playwright脚本处理javascript渲染内容。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您需要从网页HTML中提取特定数据,但缺乏有效的解析方法,则可能是由于未选择合适的工具或未正确处理HTML结构。以下是使用CodeGeeX进行网页解析的多种实现方式:
一、利用CodeGeeX生成Python BeautifulSoup解析代码
CodeGeeX可基于自然语言描述自动生成使用BeautifulSoup库解析HTML的Python代码,适用于静态网页且无需JavaScript渲染的场景。该方法依赖于HTML标签结构的稳定性,适合提取标题、段落、表格等标准元素。
1、在CodeGeeX界面输入提示词:“请生成一段Python代码,使用BeautifulSoup从HTML字符串中提取所有class为‘title’的h1标签的文本内容。”
2、复制生成的代码,在本地Python环境中安装bs4和lxml依赖:pip install beautifulsoup4 lxml。
3、将目标HTML内容赋值给变量html_str,运行代码并检查输出结果是否包含预期文本。
二、通过CodeGeeX编写Scrapy Selector提取逻辑
当需批量解析多个网页或处理嵌套较深的选择器路径时,CodeGeeX可辅助生成Scrapy风格的CSS或XPath表达式提取逻辑。该方式适用于工程化爬虫项目,要求HTML结构具备一定规律性。
1、向CodeGeeX提交请求:“生成Scrapy Shell中可用的XPath表达式,用于提取页面中所有标签内href属性以‘https://example.com/’开头的链接。”
2、获取返回的XPath表达式,例如://a[starts-with(@href, 'https://example.com/')]/@href。
3、在Scrapy Shell中执行response.xpath()调用,验证提取结果是否准确匹配目标链接集合。
CodeGeeX 2.21.0是智谱AI推出的AI编程助手版本,对Inline Chat功能进行了重大优化,包括UI设计升级、支持流式输出以提升响应速度,并新增“查看思路”按钮以便理解代码原理。同时,该版本在编辑器中新增CodeLens控件,支持一键“解释”代码或“添加注释”。目前该工具对个人开发者免费开放。
三、借助CodeGeeX构建正则表达式快速提取片段
对于HTML格式混乱、无法使用标准解析器或仅需提取简单模式(如邮箱、手机号、URL)的情况,CodeGeeX可生成定制化正则表达式。该方法不依赖DOM树,但对HTML转义与边界条件敏感。
1、输入指令:“写一个Python正则表达式,从任意HTML文本中提取形如‘contact@example.com’的邮箱地址。”
2、接收生成的re.findall()调用语句,确认其使用了非贪婪匹配与字符类约束,例如:r'[a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+\.[a-zA-Z]{2,}'。
3、在实际HTML字符串上调用该正则,观察是否过滤掉注释块或script标签内的伪邮箱。
四、使用CodeGeeX生成Playwright同步提取脚本
当目标网页依赖JavaScript动态渲染内容(如单页应用SPA),静态HTML源码不含所需数据时,CodeGeeX可生成基于Playwright的浏览器自动化提取脚本。该方法启动真实浏览器上下文,确保DOM完全加载后执行选择器查询。
1、提示CodeGeeX:“生成Playwright Python脚本,打开https://example.com,等待id为‘data-list’的元素出现,然后提取其内部所有li标签的innerText。”
2、检查生成代码是否包含page.wait_for_selector("#data-list", state="visible")调用,避免因渲染延迟导致空结果。
3、运行脚本前确保已执行playwright install chromium完成浏览器部署。
前端入门到VUE实战笔记:立即使用
在学习笔记中,你将探索 前端 的入门与实战技巧!










