要在谷歌学术精准检索预印本平台原始论文,需用site指令锁定域名如arxiv.org,并注意域名拼写、禁用高级搜索、避免filetype限制、切换英文界面及正确使用布尔逻辑批量覆盖多平台。

你想在谷歌学术中精准定位到arXiv、bioRxiv这类预印本平台上的原始论文,而不是被期刊转载的版本或二手摘要页面,必须绕过谷歌学术默认的聚合排序,直接用site指令锁定源站域名。
先确认预印本服务器的准确域名
arXiv主站是 arxiv.org,不是arxiv.com或arxiv.cn;bioRxiv是 biorxiv.org;medRxiv是 medrxiv.org;ChemRxiv是 chemrxiv.org。输错一个字母就会查不到任何结果,且谷歌学术不校验域名有效性。
这一步不能跳过——很多人搜“site:arxiv.com”,结果为空,就是因为域名写错了。
在谷歌学术中构造site检索式
打开 https://scholar.google.com ,在搜索框里输入: site:arxiv.org "attention is all you need"。
注意双引号包裹完整标题,site:后面紧贴域名,中间无空格,整个表达式不加任何其他符号。谷歌学术会强制只返回 arxiv.org 域名下的网页,包括PDF链接、摘要页、版本更新记录页。
如果搜作者,写成:site:biorxiv.org author:"james watson"。author:必须小写,冒号后不加空格,姓和名之间用空格分隔。
避开三个常见陷阱
方法一:别用谷歌学术首页的“高级搜索”界面。它不支持site语法,点进去填的字段会被忽略,最终执行的仍是普通关键词搜索。
方法二:不要在检索式末尾加“pdf”或“filetype:pdf”。arXiv所有论文PDF都托管在同一域名下,但路径结构不统一,强行加filetype反而漏掉大量结果。直接靠site:arxiv.org已足够干净。
方法三:遇到搜不到的情况,先检查是否误开了“中文界面”。谷歌学术右上角语言切换按钮若显示“中文”,请手动切回“English”,否则site指令可能被解析失败。
批量覆盖多个预印本平台
第一步:复制以下模板,粘贴进谷歌学术搜索框:
("deep learning" OR "neural network") AND (site:arxiv.org OR site:biorxiv.org OR site:medrxiv.org)
第二步:按回车执行。谷歌学术会同时扫描这三个域名,把匹配的论文混排输出,但每条结果左下角都会明确标出来源域名。
第三步:点击任意结果右侧的[PDF]链接——这一步几乎100%能直达原文PDF,因为预印本服务器不设访问墙,也不依赖订阅权限。
注意:OR site: 之间必须有空格,括号必须是英文半角,全角括号会导致语法错误且无提示。











