历趣首页 手机客户端

当前位置:历趣app下载>电脑软件>网络工具>GeneralNewsExtractor电脑版

GeneralNewsExtractor 0.2.6

系统位数:64软件大小:15.0KB更新时间:2021-07-28

支持系统:WinAll

软件厂商:

软件介绍



GeneralNewsExtractor新闻网页正文通用抽取器是一个基于《基于文本及符号密度的网页正文提取方法》论文用Python实现的正文抽取器,可以用来提取HTML中正文的内容、作者、标题。



GeneralNewsExtractor(新闻网页正文通用抽取器)是一个基于《基于文本及符号密度的网页正文提取方法》论文用Python实现的正文抽取器,可以用来提取 HTML 中正文的内容、作者、标题。

开发介绍

  项目起源

  开发这个项目,源自于我在知网发现了一篇关于自动化抽取新闻类网站正文的算法论文——《基于文本及符号密度的网页正文提取方法》)

  这篇论文中描述的算法看起来简洁清晰,并且符合逻辑。但由于论文中只讲了算法原理,并没有具体的语言实现,所以我使用 Python 根据论文实现了这个抽取器。并分别使用今日头条、网易新闻、游民星空、观察者网、凤凰网、腾讯新闻、ReadHub、新浪新闻做了测试,发现提取效果非常出色,几乎能够达到100%的准确率。

  项目现状

  在论文中描述的正文提取基础上,我增加了标题、发布时间和文章作者的自动化探测与提取功能。

  目前这个项目是一个非常非常早期的 Demo,发布出来是希望能够尽快得到大家的使用反馈,从而能够更好地有针对性地进行开发。

  本项目取名为抽取器,而不是爬虫,是为了规避不必要的风险,因此,本项目的输入是 HTML,输出是一个字典。请自行使用恰当的方法获取目标网站的 HTML。

  本项目现在不会,将来也不会提供主动请求网站 HTML 的功能。



更新日志

【更新说明】

GeneralNewsExtractor下载地址

  • 电脑版
热门APP标签
手机客户管理软件手机赚钱软件手机股票软件手机直播软件手机录屏软件 erp管理软件二手汽车交易平台app免费真人视频app应用商店解压软件
热门手游标签
手机赛车游戏手机枪战游戏手机吃鸡游戏手机传奇游戏手机三国策略游戏 传奇的手机游戏传奇手游单机回合制手游放置游戏奇迹手游
热门APP电脑版
拼多多电脑版快手电脑版小红书电脑版美团电脑版汽水音乐电脑版元气桌面壁纸电脑版CAD看图王电脑版美团外卖商家版电脑版美篇电脑版小红书千帆电脑版
热门电脑软件
微信电脑版抖音电脑版剪映专业版钉钉电脑版企业微信电脑版QQ电脑版搜狗输入法360安全浏览器美图秀秀QQ音乐电脑版
热门文章
如何建立微信群 建群的冷门小技巧微信分身苹果手机上面怎么弄 微信分身如何设置微信聊天记录怎么迁移到另一个手机吗 具体操作步骤蛋仔派对极速追逃刷分攻略 极速追逃鼠方刷分线路王者荣耀段位等级顺序2024 王者荣耀2024段位等级顺序一览微信删除的聊天记录怎么恢复 微信删除的聊天记录如何恢复西游笔绘西行平民玩啥阵容 西游笔绘西行平民阵容推荐支付宝怎么关闭免密支付自动扣费功能 支付宝关闭免密支付自动扣费功能教程百度地图时光机在哪 百度地图时光机使用相关向僵尸开炮枪械怎么获得 枪械获取攻略