
GNE(GeneralNewsExtractor)是一个通用新闻网站正文抽取模块,输入一篇新闻网页的 HTML, 输出正文内容、标题、作者、发布时间、正文中的图片地址和正文所在的标签源代码。GNE 在提取今日头条、网易新闻、游民星空、 观察者网、凤凰网、腾讯新闻、ReadHub、新浪新闻等数百个中文新闻网站上效果非常出色,几乎能够达到 100%的准确率。
使用方式非常简单:
- from gne import GeneralNewsExtractor
-
- extractor = GeneralNewsExtractor()
- html = '网站源代码'
- result = extractor.extract(html)
- print(result)
GNE 的输入是 经过 js 渲染以后的 HTML 代码,所以 GNE 可以配合 Selenium 或者 Pyppeteer 使用。
下图是 GNE 配合 Selenium 实现的一个 Demo:

对应的代码为:
- import time
- from gne import GeneralNewsExtractor
- from selenium.webdriver import Chrome
-
-
- driver = Chrome('./chromedriver')
- driver.get('https://www.toutiao.com/a6766986211736158727/')
- time.sleep(3)
- extractor = GeneralNewsExtractor()
- result = extractor.extract(driver.page_source)
- print(result)
下图是 GNE 配合 Pyppeteer 实现的 Demo: