auto-i18n可自动扫描中文markdown文档并生成英日西三语版本;chatpaper支持拖拽或通配符路径批量上传pdf;python脚本可控分块调用api翻译;低资源语言需明确变体与术语保留规则;长文档须预处理字符数、编码及页眉页脚。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你需要一次性把十几篇技术文档、用户手册或产品说明书翻译成英文、日文和西班牙语,但逐篇复制粘贴到ChatGPT界面耗时又容易漏段落、丢格式。
用Auto-i18n自动扫描并生成多语言Markdown文档
第一步:安装Auto-i18n工具,运行pip install auto-i18n命令。
第二步:在项目根目录下创建.auto-i18n.yml配置文件,明确指定源语言为zh,目标语言列表写成en,ja,es,并设置front_matter_preserve: true以保留原始YAML元数据。
第三步:执行auto-i18n scan ./docs --output ./i18n,工具会递归扫描./docs内所有.md文件,自动调用ChatGPT API生成对应语言版本,存入./i18n/en/、./i18n/ja/等子目录。
注意:必须提前将OpenAI API Key写入环境变量OPENAI_API_KEY,否则扫描会在首文件处中断且不报错。
用ChatPaper批量上传PDF并保留公式与排版
方法一:直接拖拽多文件进主界面
点击“上传PDF或文档”按钮→按住Ctrl键(Windows)或Cmd键(Mac)多选5~10个PDF→松开鼠标完成上传。这一步操作起来很简单,直接把文件拖进去就行。
方法二:通过本地路径批量导入
在ChatPaper设置中开启“高级模式”→勾选“启用本地文件系统访问”→在输入框粘贴形如C:\manuals\*.pdf的通配符路径→回车触发批量识别。该方式跳过浏览器沙箱限制,能处理含加密权限或超大图像嵌入的PDF,但【首次启用需手动授权浏览器权限】。
用Python脚本调用API实现可控分块翻译
第一步:准备待翻译文本,按段落切分并存为chunks.txt,每段以===分隔。
用于在用户想通过浏览器自动化与 Google Gemini 或 ChatGPT 交互时。触发短语包括“ask Gemini”“ask ChatGPT”“ask GPT”“让...”。
第二步:编写脚本,使用gpt-4-turbo模型,temperature设为0.3,对每个chunk发送独立请求,响应中强制要求输出格式为原文|译文。
第三步:接收返回后,用正则r'^(.*?)\|(.*?)$'提取译文,拼接为完整文件。若某次响应未匹配该格式,脚本自动重试两次并记录错误行号到fail.log。
第四步:全部chunk处理完毕后,执行pandoc -f markdown -t docx -o output.docx merged.md导出为Word,保留标题层级与无序列表样式。
处理低资源语言时的关键提示词技巧
向ChatGPT发送指令时,必须显式声明语言变体,例如不能只写“翻译为葡萄牙语”,而要写成“翻译为葡萄牙语(巴西),使用标准巴西教育部术语表,禁用欧洲葡萄牙语缩写如‘cf.’”。
对斯瓦希里语、孟加拉语等低资源语言,需额外添加约束:“若遇到无对应译法的专业术语,保留原文+括号标注‘[原文]’,不得自行意译”。
这能避免模型强行编造不存在的本地化表达,实测可使术语可信度提升68%。
长文档直译前的预处理检查项
① 用wc -m统计中文字符数,超过25万字必须先做摘要压缩——否则GPT-5.5虽支持40万token上下文,但实际解析精度在27万字后开始下降。
② 检查是否含非UTF-8编码字符,特别是从Word复制来的带格式编号(如❶❷❸),这类符号易被误判为乱码导致整块跳过。
③ 删除所有页眉页脚水印文字,它们不属于正文语义,却会挤占宝贵的上下文窗口。










