如何通过 Kununu 动态评论页的官方 API 完整抓取全部评价与评分数据

冬浩吖_7344

冬浩吖_7344

2026-08-14

1001人浏览

原创

如何通过 Kununu 动态评论页的官方 API 完整抓取全部评价与评分数据

本文详解如何绕过前端动态加载限制,直接调用 kununu 官方 ajax api 批量获取全部员工评论及评分数据,避免因点击“查看更多”导致的 json 数据滞后问题。

本文详解如何绕过前端动态加载限制,直接调用 kununu 官方 ajax api 批量获取全部员工评论及评分数据,避免因点击“查看更多”导致的 json 数据滞后问题。

Kununu 评论页面(如 https://www.kununu.com/de/adidas/kommentare)采用服务端渲染(SSR)+ 客户端动态分页加载的混合架构:初始 HTML 中嵌入的 #__NEXT_DATA__ 脚本仅包含首屏(通常为前 10 条)评论的静态快照;后续点击“Read more reviews”触发的是前端向独立后端 API 发起的异步请求,该 API 返回的数据不会自动注入到 #__NEXT_DATA__ 中——因此即使你通过 Selenium 模拟点击并刷新 page_source,#__NEXT_DATA__ 的内容仍保持初始状态,造成 JSON 数据“未更新”的假象。

真正可靠的方式是跳过浏览器自动化,直接对接其公开的 RESTful API。经分析,Kununu 使用统一接口 /middlewares/profiles/{country}/{company-slug}/{company-id}/reviews 获取分页评论,其中 company-id 可从任意一条评论链接中提取(例如 <a href="/review/123456789/..."></a> 中的 123456789)。

以下为完整、可复用的 Python 实现:

import requests
from bs4 import BeautifulSoup

def fetch_all_kununu_reviews(company_url: str, max_pages: int = 5) -> list:
    # 1. 获取公司 ID(从首条评论链接解析)
    response = requests.get(company_url, headers={"User-Agent": "Mozilla/5.0"})
    soup = BeautifulSoup(response.content, "html.parser")
    review_link = soup.select_one('a[href*="/review/"]')
    if not review_link or not review_link.get("href"):
        raise ValueError("无法定位公司 ID:未找到 /review/ 链接")

    company_id = review_link["href"].split("/")[3]  # 注意路径结构:/review/{id}/...

    # 2. 构造 API 基地址(注意国家代码与公司 slug 需与原始 URL 一致)
    base_api_url = "https://www.kununu.com/middlewares/profiles/{country}/{slug}/{id}/reviews"

    # 解析原始 URL 中的 country 和 slug(如 de/adidas)
    parts = [p for p in company_url.rstrip("/").split("/") if p]
    country_slug = parts[-2:] if len(parts) >= 2 else ["de", "adidas"]
    country, slug = country_slug[0], country_slug[1]

    api_url = base_api_url.format(country=country, slug=slug, id=company_id)

    # 3. 分页请求 API
    all_reviews = []
    for page in range(1, max_pages + 1):
        params = {
            "fetchFactorScores": "0",
            "reviewType": "employees",  # 可选 employees / applicants / customers
            "urlParams": "",
            "page": str(page),
        }
        try:
            resp = requests.get(api_url, params=params, timeout=10)
            resp.raise_for_status()
            data = resp.json()

            # 提取每条评论的核心字段
            for rev in data.get("reviews", []):
                review_data = {
                    "id": rev.get("id"),
                    "rating": rev.get("rating"),  # 总体评分(1-5)
                    "date": rev.get("date"),
                    "author_role": rev.get("author", {}).get("role"),
                    "texts": [t["text"] for t in rev.get("texts", []) if t.get("text")],
                    "factors": rev.get("factorScores", {})  # 如 Work-Life-Balance, Salary 等细分项
                }
                all_reviews.append(review_data)
        except Exception as e:
            print(f"第 {page} 页请求失败:{e}")
            break

    return all_reviews

# 使用示例
if __name__ == "__main__":
    url = "https://www.kununu.com/de/adidas/kommentare"
    reviews = fetch_all_kununu_reviews(url, max_pages=3)

    print(f"共获取 {len(reviews)} 条评论")
    for i, r in enumerate(reviews[:5], 1):  # 打印前 5 条示例
        print(f"\n【{i}】评分:{r['rating']} | 日期:{r['date']}")
        for text in r["texts"]:
            print(f"  • {text.strip()}")
        if r["factors"]:
            print(f"  → 细分项:{r['factors']}")

✅ 关键优势:

  • 稳定性高:不依赖浏览器渲染与 DOM 操作,规避反爬干扰(如 Consent 弹窗、JS 加载延迟);
  • 数据完整:API 原生支持分页,可精确控制获取总页数,确保无遗漏;
  • 结构清晰:直接返回结构化 JSON,含评分、时间、角色、细分因子(如工作生活平衡、薪酬等),无需额外解析;
  • 可扩展性强:轻松切换 reviewType 参数抓取应聘者或客户评价。

⚠️ 注意事项:

  • 请求头建议添加 User-Agent,避免被限流;
  • 生产环境应加入请求间隔(如 time.sleep(1))和错误重试机制;
  • company-id 是动态生成的,务必从目标页面实时提取,不可硬编码;
  • Kununu 可能对高频请求进行频率限制,单次任务建议 max_pages ≤ 10,大规模采集需分布式 IP 或代理池。

通过此方案,你将彻底摆脱 Selenium 点击与 #__NEXT_DATA__ 同步失效的困境,以轻量、高效、可维护的方式获取全量高质量评论数据。

大量免费API接口:立即使用
涵盖生活服务API、金融科技API、企业工商API、等相关的API接口服务。免费API接口可安全、合规地连接上下游,为数据API应用能力赋能!

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
html版权符号
html版权符号

html版权符号是“©”,可以在html源文件中直接输入或者从word中复制粘贴过来,php中文网还为大家带来html的相关下载资源、相关课程以及相关文章等内容,供大家免费下载使用。

2023.06.14

5755

7

html在线编辑器
html在线编辑器

html在线编辑器是用于在线编辑的工具,编辑的内容是基于HTML的文档。它经常被应用于留言板留言、论坛发贴、Blog编写日志或等需要用户输入普通HTML的地方,是Web应用的常用模块之一。php中文网为大家带来了html在线编辑器的相关教程、以及相关文章等内容,供大家免费下载使用。

2023.06.21

3272

4

html网页制作
html网页制作

html网页制作是指使用超文本标记语言来设计和创建网页的过程,html是一种标记语言,它使用标记来描述文档结构和语义,并定义了网页中的各种元素和内容的呈现方式。本专题为大家提供html网页制作的相关的文章、下载、课程内容,供大家免费下载体验。

2023.07.31

2930

5

html空格
html空格

html空格是一种用于在网页中添加间隔和对齐文本的特殊字符,被用于在网页中插入额外的空间,以改变元素之间的排列和对齐方式。本专题为大家提供html空格的相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.01

2959

5

html是什么
html是什么

HTML是一种标准标记语言,用于创建和呈现网页的结构和内容,是互联网发展的基石,为网页开发提供了丰富的功能和灵活性。本专题为大家提供html相关的各种文章、以及下载和课程。

2023.08.11

4779

6

html字体大小怎么设置
html字体大小怎么设置

在网页设计中,字体大小的选择是至关重要的。合理的字体大小不仅可以提升网页的可读性,还能够影响用户对网页整体布局的感知。php中文网将介绍一些常用的方法和技巧,帮助您在HTML中设置合适的字体大小。

2023.08.11

2901

3

html转txt
html转txt

html转txt的方法有使用文本编辑器、使用在线转换工具和使用Python编程。本专题为大家提供html转txt相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.31

2709

3

html文本框代码怎么写
html文本框代码怎么写

html文本框代码:1、单行文本框【<input type="text" style="height:..;width:..;" />】;2、多行文本框【textarea style=";height:;"></textare】。

2023.09.01

2408

6

HTML嵌入CSS样式的方法
HTML嵌入CSS样式的方法

HTML嵌入CSS样式的方法有内联样式、内部样式表和外部样式表。本专题为大家提供CSS样式相关的文章、下载、课程内容,供大家免费下载体验。

2023.09.20

2448

5

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
phpStudy极速入门视频教程
phpStudy极速入门视频教程

共6课时 | 54.6万人学习

独孤九贱(4)_PHP视频教程
独孤九贱(4)_PHP视频教程

共89课时 | 133.4万人学习