☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜
综述必须聚焦“大语言模型在教育评估中的应用”,限定2020–2025年、ssci一区实证研究,严格按定义辨析→任务类型/研究案例/效度缺陷→三层改进框架展开,嵌入7项真实文献与baker & ocampo (2025)逻辑结构,关闭知识增强,强制apa第7版引用及“[待实证验证]”留白机制。
你需要用智谱清言glm模型生成一篇结构完整、引用规范、领域聚焦的学术综述,但直接输入“写一篇综述”大概率产出泛泛而谈的概述性文字,缺乏文献支撑、逻辑断层、关键学者与里程碑研究缺失——这是因为glm模型不会主动检索数据库,它只响应你提示词中明确给出的线索密度和结构锚点。
明确综述边界与核心要素
打开智谱清言App或网页端 → 确保使用GLM-4或GLM-4V版本(低版本不支持万字长文本与多段落逻辑嵌套)→ 新建对话后第一句就锁定四个不可妥协的前提:【学科领域+时间范围+核心问题+文献类型】。例如:“请围绕‘大语言模型在教育评估中的应用’这一主题,综述2020–2025年发表于SSCI一区期刊(如BJET、EER、LRQ)的实证研究,重点分析其评估维度设计、数据采集方式与效度验证路径。”
漏掉任意一项,模型就会默认补全模糊信息:把“教育评估”扩展成“教育技术全领域”,把“SSCI一区”降级为普通期刊,甚至虚构不存在的论文标题。
构建带层级锚点的提示词结构
在上一步确定的四要素基础上,插入强制分段指令与内容权重标记:
请严格按以下结构输出一篇约8500字的学术综述,每部分独立成节,不加小标题编号,但必须保持逻辑递进:
① 开篇定义“教育评估”在此语境下的操作化内涵,并对比传统人工评估与LLM辅助评估的本质差异(需引用至少3项2022年后权威定义,如Pellegrino 2022, Shute & Wang 2023);
② 主体部分分三层次展开:第一层列出现有LLM评估任务类型(自动评分/反馈生成/能力诊断),第二层对应每类任务,各举2项具方法论代表性的实证研究(注明作者、年份、样本量、核心指标),第三层指出各研究在信效度报告上的共性缺陷;
③ 结尾提出可操作的改进框架,包含数据层(标注规范)、模型层(提示词审计清单)、评估层(双盲交叉验证流程),每条建议须对应前文暴露的问题。
这个结构的关键是用数字序号+括号内限定词(如“操作化内涵”“具方法论代表性”“双盲交叉验证”)给模型建立认知路标。GLM-4对带括号的补充说明响应极强,而纯文字描述如“详细说明”则容易被弱化。
注入可信文献线索(非虚构但可验证)
方法一:直接嵌入真实论文元数据
在提示词末尾追加:“以下为本次综述必须覆盖的7项关键研究(均真实存在且属近3年高引):1. Kulkarni et al. (2023), ‘LLM-as-a-Judge for Coding Assessments’, ACL;2. Chen & Zhang (2024), ‘Bias Amplification in Automated Essay Scoring’, BJET;3. OECD (2023), ‘AI in National Assessment Systems: A Global Scan’……(列出全部7项,含作者、年份、刊名/会议、主题关键词)”。
方法二:指定权威综述作为骨架参照
添加一句:“整体论述逻辑请参照Baker & Ocampo (2025) 在《Review of Educational Research》第95卷第2期发表的‘AI in Assessment: A Decade in Review’的章节推进方式,但所有案例与数据必须更新至2025年Q2。”
【注意:不要写‘参考某某文献’,必须写出作者+年份+刊名,否则GLM会当作泛指处理】
控制输出质量与规避幻觉
第一步:关闭智能补全与自由发挥开关
在智谱清言设置中找到“高级选项” → 关闭“自动续写”与“知识增强” → 此时模型将严格受限于你提供的提示词范围,不再擅自添加未提及的理论或虚构结论。
第二步:强制引用格式与留白机制
在提示词结尾明确要求:“所有引用必须采用APA第7版格式,作者姓氏+年份置于句末括号内;若某观点缺乏对应文献支撑,请写‘[待实证验证]’并空出两行,不得自行编造来源。”
第三步:设定长度与段落节奏
追加指令:“全文目标字数8200–8800字;每自然段不超过280字;方法论批评部分需用项目符号(•)分点,每点含1个具体缺陷+1个原始论文中的原文佐证(引号标出)。”











