避免您的业务中出现这些大数据错误

Reatha
  • 利用大数据对企业来说是一个挑战,但了解一些常见错误会有所帮助

不断提醒企业数据的重要性。毫无疑问,有效利用它的能力变得至关重要。从深入了解客户的需求并预测他们的行为,到参与机器学习模型的开发,充分利用数据可以为组织带来显着的战略优势。但仍然存在挑战,从他们应该聘请的专家、他们应该对工具和解决方案进行的投资,以及他们应该使用哪些数据巨大且不断增长的宝藏,对企业自身的需求拥有最大的价值。数据科学家发现了企业在尝试充分利用大数据时犯下的一些重大错误。

然而,商业媒体非常关注组织应该如何处理数据,以下是企业应该避免的一些常见数据错误,根据计算机科学家、数据库研究先驱、麻省理工学院兼职教授 Michael Stonebraker。

不迁移到云端

如果您的组织不打算成为云专有企业,那么您可能会支持正在流失的技术。云比您的内部解决方案更具弹性,从长远来看更具成本效益。Azure 和 AWS 等大型云提供商以极低的成本提供存储,并提供更好的基础设施(通常具有更严格的安全性)以及专门从事云管理的员工。

“他们部署了数百万台服务器;而你则部署了数万台服务器,”他说。 “它们的成本曲线进一步上升,并提供了巨大的规模经济。”

回避人工智能和机器学习

人工智能无疑会扰乱运营。它将取代一些劳动力,并有可能颠覆组织处理运营的方式。话虽这么说,你可以选择成为颠覆者,也可以选择逃避现实并被颠覆。

解决方案是什么?为人才付费的意愿。机器学习专家的价格不会便宜,人力资源部门很有可能会犹豫,但现在花钱请专家会给你带来更大的回报。“这将会是一场军备竞赛,”他在谈到招聘人才的竞争时说道。 “尽快开始吧。”

忽视真正的数据科学问题

也许并不光鲜亮丽,数据科学家90%的时间都花在数据发现、数据集成和数据清理上。如果没有干净的数据,您的大数据计划就毫无意义。你的机器学习毫无价值。不要错过这一步。

公司应该建立一个系统并坚持下去,因为你的数据科学家、你花钱的人才以及与人力资源部门争夺的人才可以帮助引领潮流。但您的组织需要解决真正的数据问题——数据质量。他说,解决这个问题的最佳方法是制定明确的数据清理和集成策略,并配备首席数据官。

相信“传统”技术

传统的数据集成在大数据世界中已经无法发挥作用。两个最常见的流程:提取、转换、加载 (ETL) 和主数据管理 (MDM) 流程过于陈旧,无法正常工作且无法扩展。

相信数据仓库会解决您的所有问题

数据仓库可以解决一些大数据问题,但不是全部。斯通布雷克说,仓库不适用于文本、图像和视频等内容。相反,应将数据仓库用于其擅长的用途,例如来自几个数据源的面向客户的结构化数据。

“摆脱高价差,永远记住,你的仓库将迁移到云端,”他说。

屈服于“创新者的困境”

通常,遗留系统必须被放弃,即使它会导致巨大的变化或可能失去客户。这是一条不断押注未来并能够重塑组织的道路。 “你必须愿意在任何高科技领域这样做,”斯通布雷克说。

将新东西外包给大数据分析服务公司

斯通布雷克说,新工具不应该外包。他说,其他事情应该进行,例如维护,并且在进行维护时,不要运行自己的电子邮件系统。

假设数据湖将解决所有问题。

股票经纪人建议公司使用数据管理系统清理湖数据。 Stonebraker 说:“这个问题从我成年以来就一直存在,通过应用机器学习和现代技术,这个问题变得越来越容易。”但这仍然不容易,公司应该派出最好的员工来解决这个问题。

“不要使用你的自制系统,”他在谈到通常已经过时的内部技术时说道。他说,通常,最好的数据管理系统来自初创公司。

不,Hadoop/Spark 并不能解决您的所有问题。

Stonebraker 表示,Hadoop(Apache 的开源软件集合)或 Spark(该公司用于大数据处理的分析引擎)不应该成为所有事物或所有人的答案。但许多公司已经对其进行了投资。

“在我看来,你应该关注最好的技术,而不是最低的共同点,”斯通布雷克说。 Stonebraker 断言,“Spark 和 Hadoop 在数据集成方面毫无用处”,而这正是数据科学家花费大量时间的地方。