Home >Backend Development >PHP Tutorial >javascript - 求大神破解印象笔记chrome插件“悦读”的识别算法

javascript - 求大神破解印象笔记chrome插件“悦读”的识别算法

WBOY
WBOYOriginal
2016-06-06 20:44:301263browse

最近因为要做一个采集网页主体内容的软件,所以找了好久,最后觉得“悦读”的效果最理想。
有装了“悦读”的同学可以在C:\Users\Administrator\AppData\Local\Google\Chrome\User Data\Default\Extensions\iooicodkiihhpojmmeghjclgihfjdjhjchrome
找到源码,因本人学业不精,目前还无法看懂代码如何调用,求大神指点,急用,万分感谢。

回复内容:

最近因为要做一个采集网页主体内容的软件,所以找了好久,最后觉得“悦读”的效果最理想。
有装了“悦读”的同学可以在C:\Users\Administrator\AppData\Local\Google\Chrome\User Data\Default\Extensions\iooicodkiihhpojmmeghjclgihfjdjhjchrome
找到源码,因本人学业不精,目前还无法看懂代码如何调用,求大神指点,急用,万分感谢。

我觉得其实就是html的解析,这块你看看各种爬虫是怎么写的就行了

早期的印象的文本提取用的是这个库https://github.com/hatena/extract-content-javascript/,不过印象笔记收编了Readability的作者后,貌似换了文本提取引擎。

Statement:
The content of this article is voluntarily contributed by netizens, and the copyright belongs to the original author. This site does not assume corresponding legal responsibility. If you find any content suspected of plagiarism or infringement, please contact admin@php.cn