
本文详解如何绕过前端动态加载限制,直接调用 kununu 官方 ajax api 批量获取全部员工评论及评分数据,避免因点击“查看更多”导致的 json 数据滞后问题。
本文详解如何绕过前端动态加载限制,直接调用 kununu 官方 ajax api 批量获取全部员工评论及评分数据,避免因点击“查看更多”导致的 json 数据滞后问题。
Kununu 评论页面(如 https://www.kununu.com/de/adidas/kommentare)采用服务端渲染(SSR)+ 客户端动态分页加载的混合架构:初始 HTML 中嵌入的 #__NEXT_DATA__ 脚本仅包含首屏(通常为前 10 条)评论的静态快照;后续点击“Read more reviews”触发的是前端向独立后端 API 发起的异步请求,该 API 返回的数据不会自动注入到 #__NEXT_DATA__ 中——因此即使你通过 Selenium 模拟点击并刷新 page_source,#__NEXT_DATA__ 的内容仍保持初始状态,造成 JSON 数据“未更新”的假象。
真正可靠的方式是跳过浏览器自动化,直接对接其公开的 RESTful API。经分析,Kununu 使用统一接口 /middlewares/profiles/{country}/{company-slug}/{company-id}/reviews 获取分页评论,其中 company-id 可从任意一条评论链接中提取(例如 <a href="/review/123456789/..."></a> 中的 123456789)。
以下为完整、可复用的 Python 实现:
import requests
from bs4 import BeautifulSoup
def fetch_all_kununu_reviews(company_url: str, max_pages: int = 5) -> list:
# 1. 获取公司 ID(从首条评论链接解析)
response = requests.get(company_url, headers={"User-Agent": "Mozilla/5.0"})
soup = BeautifulSoup(response.content, "html.parser")
review_link = soup.select_one('a[href*="/review/"]')
if not review_link or not review_link.get("href"):
raise ValueError("无法定位公司 ID:未找到 /review/ 链接")
company_id = review_link["href"].split("/")[3] # 注意路径结构:/review/{id}/...
# 2. 构造 API 基地址(注意国家代码与公司 slug 需与原始 URL 一致)
base_api_url = "https://www.kununu.com/middlewares/profiles/{country}/{slug}/{id}/reviews"
# 解析原始 URL 中的 country 和 slug(如 de/adidas)
parts = [p for p in company_url.rstrip("/").split("/") if p]
country_slug = parts[-2:] if len(parts) >= 2 else ["de", "adidas"]
country, slug = country_slug[0], country_slug[1]
api_url = base_api_url.format(country=country, slug=slug, id=company_id)
# 3. 分页请求 API
all_reviews = []
for page in range(1, max_pages + 1):
params = {
"fetchFactorScores": "0",
"reviewType": "employees", # 可选 employees / applicants / customers
"urlParams": "",
"page": str(page),
}
try:
resp = requests.get(api_url, params=params, timeout=10)
resp.raise_for_status()
data = resp.json()
# 提取每条评论的核心字段
for rev in data.get("reviews", []):
review_data = {
"id": rev.get("id"),
"rating": rev.get("rating"), # 总体评分(1-5)
"date": rev.get("date"),
"author_role": rev.get("author", {}).get("role"),
"texts": [t["text"] for t in rev.get("texts", []) if t.get("text")],
"factors": rev.get("factorScores", {}) # 如 Work-Life-Balance, Salary 等细分项
}
all_reviews.append(review_data)
except Exception as e:
print(f"第 {page} 页请求失败:{e}")
break
return all_reviews
# 使用示例
if __name__ == "__main__":
url = "https://www.kununu.com/de/adidas/kommentare"
reviews = fetch_all_kununu_reviews(url, max_pages=3)
print(f"共获取 {len(reviews)} 条评论")
for i, r in enumerate(reviews[:5], 1): # 打印前 5 条示例
print(f"\n【{i}】评分:{r['rating']} | 日期:{r['date']}")
for text in r["texts"]:
print(f" • {text.strip()}")
if r["factors"]:
print(f" → 细分项:{r['factors']}")
✅ 关键优势:
- 稳定性高:不依赖浏览器渲染与 DOM 操作,规避反爬干扰(如 Consent 弹窗、JS 加载延迟);
- 数据完整:API 原生支持分页,可精确控制获取总页数,确保无遗漏;
- 结构清晰:直接返回结构化 JSON,含评分、时间、角色、细分因子(如工作生活平衡、薪酬等),无需额外解析;
-
可扩展性强:轻松切换
reviewType参数抓取应聘者或客户评价。
⚠️ 注意事项:
- 请求头建议添加
User-Agent,避免被限流; - 生产环境应加入请求间隔(如
time.sleep(1))和错误重试机制; -
company-id是动态生成的,务必从目标页面实时提取,不可硬编码; - Kununu 可能对高频请求进行频率限制,单次任务建议
max_pages ≤ 10,大规模采集需分布式 IP 或代理池。
通过此方案,你将彻底摆脱 Selenium 点击与 #__NEXT_DATA__ 同步失效的困境,以轻量、高效、可维护的方式获取全量高质量评论数据。
大量免费API接口:立即使用
涵盖生活服务API、金融科技API、企业工商API、等相关的API接口服务。免费API接口可安全、合规地连接上下游,为数据API应用能力赋能!










