近年来,以智能手机为代表的移动终端的生产、消费量迅猛增加,这带动了移动互联网产业的高速发展,因而移动互联网被越来越受到重视。就在这样的时代背景下,各种app如雨后春笋般涌现出来,由于app可以实现各种各样的功能,且方便实用,受到移动终端用户的欢迎。

在智能手机上人们通常除了安装社交app之外,大部分用户还可能会安装资讯类app,如今日头条、一点资讯、搜狐新闻客户端等等。资讯类app中的新闻资讯一般即时性较强,而且这些资讯类app中的资讯绝大部分都是来自与其他资讯网站,那么他们是怎么实现app海量信息的更新的呢?这就涉及到app的大数据获取。

显然,人工手动发布是不太现实的,除非是独家发布的资讯。那么以大数据方式是如何获取大量资讯的呢?下面以科技工社为例来简单说明这个问题。

1

目前科技资讯app在国内市场上可谓凤毛麟角,科技工社是笔者比较了解的一款科技资讯类app,且目前也只有ios版本。其大部分资讯的获取方式与今日头条、一点资讯类似,就是利用爬虫进行爬取。

具体方法就是在多台服务器上同时部署爬虫程序,配置不同的爬虫调用同一数据库,使用多台服务器是为了提高爬取数据的速度,调用同一数据库可以避免不同服务器间的爬虫重复工作。接下来,就是在app的人工管理后台配置目标网站的种子信息,包括一些基本信息、URL过滤规则和文本过滤规则等。

配置种子信息时可以设置成无需人工审核,这时候如果目标网站新的数据更新,那么爬虫爬取数据过来之后就自动发布到app上,无需人工操作。而且由于爬虫是部署在服务器组上的,所以工作效率都比较高,可以实现海量数据的实时处理。

除此之外,编辑人员也可以手工发布一些在互联网媒体上没有的资讯或外国媒体上的资讯。如今,新闻资讯类app大数据的获取在技术上已经十分成熟。然而,对我们这些好奇的普通读者而言,可能觉得很神秘。其实,当你真正了解一项技术的时候便不觉得神秘。

关注中国IDC圈官方微信:idc-quan 我们将定期推送IDC产业最新资讯

查看心情排行你看到此篇文章的感受是:


  • 支持

  • 高兴

  • 震惊

  • 愤怒

  • 无聊

  • 无奈

  • 谎言

  • 枪稿

  • 不解

  • 标题党
2023-03-30 11:15:07
云资讯 分布式时代已至,数据如何更有价值?
无论是连通各大集群内大型超大型数据中心,还是连接边缘侧小型、边缘数据中心,分布式云计算都已成为这张算力网络最重要的支撑。在此背景下,云计算步入分布式时代。 <详情>
2023-03-01 19:27:00
市场情报 FlagOpen大模型技术开源体系,开启大模型时代“新Linux”生态
大数据+大算力+强算法=大模型”是当前人工智能发展的主要技术路径。语言大模型ChatGPT成为现象级应用,人工智能进入普及应用的新时期。 <详情>
2023-01-09 09:36:46
大数据资讯 我国互联网广告数据匿名实施服务正式上线
《指南》形成的“技术保障、评估规制、过程控制”的互信制衡机制,适用于各类互联网广告业务,包括广告投放、程序化交易、广告监测等应用场景下的数据匿名化处理。 <详情>
2022-12-30 10:10:19
大数据资讯 中国移动磐维数据库正式发布
未来,随着数据库功能和稳定性等进一步增强,磐维数据库将在中国移动内外部的广泛应用中积累更多复杂业务场景实践经验,进一步提升数据库产品的核心技术能力,助力数智化转 <详情>
2022-12-26 09:43:37
大数据资讯 贵阳大数据交易所年度交易额突破3.59亿元
据悉,下一步,阳大数据交易所将持续完善数据流通交易产业链,强化政策扶持和数据供给,构建数据流通交易市场体系,促进数据交易规范化、 市场化,推动数据要素实现有序流 <详情>