广告标签常见于等容器及含ad/banner等语义的class/id,需结合位置(页首/侧栏/段落间)和css选择器精准定位,优先用decompose()删除,同时清理script/style/noscript中的广告残留,并注意避免误伤推荐内容。

定位广告标签的常见特征
广告通常藏在 <div>、<code><aside></aside> 或带特定 class/id 的容器里,比如 class="ad"、id="sidebar-ad"、data-ad-slot 等。但不能只靠关键词暴力匹配——有些正文内容也含 “ad”(如 “adaptive”),有些广告用动态 class 名(如 class="js-ad-12345")。优先看结构位置:页首/页尾固定区域、侧栏、文章段落之间插入的独立块。
用 select() + decompose() 精准移除,别用 extract()
decompose() 彻底删除节点及其子树,不返回任何对象;extract() 会返回被移除的 Tag,容易误留引用或触发重复操作。对广告清理这种“只删不复用”的场景,decompose() 更安全。
实操建议:
- 用
soup.select('div[class*="ad"], aside[data-ad], [id*="banner"]')匹配含广告语义的元素(*=表示属性值包含) - 避开正文区域:加前置限定,如
'body > footer .ad', 'article ~ .ad'(注意 CSS 选择器中~是后续兄弟元素) - 删除前先检查:
for tag in soup.select('.ad'): print(tag.name, tag.get('class')),确认没误伤
处理内联广告脚本和 style 注入
有些广告通过 <script></script> 动态插入,或用 style="display: block" 控制显隐。BeautifulSoup 不执行 JS,所以得手动清理残留:
- 删掉广告相关 script:
soup.find_all('script', string=lambda t: t and 'taboola' in t or 'googlesyndication' in t)→.decompose() - 清空可疑内联样式:
for tag in soup.find_all(style=True): if 'ad' in tag['style'].lower(): tag['style'] = '' - 警惕
<noscript></noscript>里的广告图片:soup.select('noscript img[src*="doubleclick"]')
保留语义结构,别让 cleanup 后的 HTML 崩坏
直接删掉 <div class="ad-wrapper"> 可能导致父容器只剩空白文本节点,影响后续 <code>get_text() 提取。清理后建议调用 soup.smooth() 合并相邻文本节点,再用 soup.prettify() 检查结构是否连贯。
容易被忽略的一点:某些站点把广告和推荐内容混在同一 class 下(如 class="related-content"),此时仅靠 class 删除会误伤。必须结合上下文位置判断——比如只删 article 外部的,或紧邻 <hr> 的区块。











