无论在报纸、杂志、机场媒体,还是在酒吧的闲谈中,大数据都成了一个热门话题。每个人都在谈论这个时尚的话题,但迄今为止只有极少数企业真正成功的运用这一技术!导致这一情况的重要原因就是企业对建立可操作的大数据分析模型成功关键因素缺乏深刻的认识。结合多年来与多家全球性公司合作经验,我们认为:为了取得成功,大数据分析模型需要满足如下几种要求:

数据1

(1)业务相关性。

业务相关性是对分析模型的第一个关键要求。分析模型必须能够解决特定的商业问题。那些性能优越,却不能解决商业问题的模型是毫无意义的。显然,在模型开发前,对商业背景和业务问题有全面的理解必不可少。例如,在保险欺诈检测问题中,必须在一开始对如何定义、衡量和管理欺诈有清晰的界定。     

(2)统计性能。

影响模型成功的另一个重要关键因素是模型性能表现。换句话说,从统计意义的角度,分析模型应该显着提高预测或描述的性能。根据分析问题的类型不同,常常采用不同类型的性能评价指标。在客户细分,统计评价指标主要评价对比簇内的相似性与簇间的差异性;在客户流失预测中,主要评价模型是否赋予了潜在流失客户的较高得分。     

(3)解释性和合理性。

解释性是指分析模型容易为决策者所理解,合理性是指模型与专家的预期和业务知识相一致。解释能力和合理性都是主观判断,取决于决策者的知识和经验。这两个因素与统计性能分析之间常常是矛盾的,譬如:复杂神经网络和随机森林模型预测性能较好,但是解释性较差。所以,决策者需要在两者之间寻找平衡点。在信用风险分析等应用场景中,解释性和合理性是非常重要的因素,而在欺诈检测和营销响应建模中,这一因素就不是那么重要了。     

(4)运行效率。

运行效率涉及模型评估、监测、检验及重建过程中所需投入的时间。从这个因素来看,很明显的神经网络或随机森林效率较低,而回归模型和决策树等更有效率。在信用卡欺诈检测等业务场景中,运行效率是非常重要的,因为所有的决策必须在信用卡交易开始后几秒钟内完成。

(5)经济成本。经济成本是收集模型所需数据、运行模型以及分析模型结果的过程中所投入的成本,此外还包括引入外部数据和模型的成本。在分析模型的经济回报时,所有的这些成本都必须考虑在内,通常不是能简单直接计算出来的。     

(6)合规性。在很多行业中,合规性变得越来越重要。合规性是指模型对现有制度和法律的遵从程度。在信用风险领域,分析模型符合巴塞尔协议II和III的规定尤其重要。而在保险行业中,模型则必须遵从欧盟偿付能力协议(Solvency II) 。     

总结以上,我们简要论述了成功构建数据分析模型的关键因素。如我们所指出的那样,每个因素的重要性取决于模型应用场景。

关注中国IDC圈官方微信:idc-quan 我们将定期推送IDC产业最新资讯

查看心情排行你看到此篇文章的感受是:


  • 支持

  • 高兴

  • 震惊

  • 愤怒

  • 无聊

  • 无奈

  • 谎言

  • 枪稿

  • 不解

  • 标题党
2018-04-16 10:06:05
云资讯 大庆市云计算大数据产业工作会议召开
4月13日,大庆市召开云计算大数据产业工作会议,系统总结大庆市大数据云计算产业发展情况,安排部署下步工作任务。市委常委、常务副市长何忠华出席并讲话,副市长于宸、安 <详情>
2018-04-16 09:34:00
大数据资讯 全国城市农贸代表团参观眉山农业云大数据中心
12日上午,由全国城市农贸中心联合会主办,眉山市商务局、眉山圣丰农产品批发市场投资有限公司承办的第十四届全国农产品批发市场联络员大会在眉山举行,来自全国城市农贸中 <详情>
2018-04-16 09:31:00
大数据资讯 上海市大数据中心揭牌 用“数据跑路”替代“群众跑腿”
上海市大数据中心12日正式揭牌。作为“智慧政府”的基础设施,上海将依托大数据中心这个城市数据枢纽,打破部门“数据孤岛”,推动政务服务从“群众跑腿”向“数据跑路”转 <详情>
2018-04-16 09:28:00
大数据资讯 国家健康医疗大数据中心落户长乐 用地1000亩
福州的大数据产业正加速发展。昨日,国家健康医疗大数据中心与产业园建设试点工程(福州园区)挂牌仪式在长乐举行。 <详情>
2018-04-13 15:06:35
大数据资讯 上海大数据中心揭牌成立 今年建成政务“一网通办”总门户
让群众少跑腿,让数据多跑路,实现从“找部门”到“找政府”的根本转变。上海市政府今天下午发布《全面推进“一网通办”加快建设智慧政府工作方案》。 <详情>