通过数据库内机器学习加快实现价值
大多数业务决策者都知道业务积累的数据具有价值。然而,释放这种价值需要时间和金钱投资的成本。当提出机器学习问题时尤其如此:当然,机器学习将帮助业务处理其数据资源,以释放有价值的见解、趋势分析、模式预测等,但是什么时候以及完成时是否值得?
领导专注于机器学习的专门团队需要仔细选择项目和确定项目的优先级,并接受任何结果都需要时间的事实——很少有决策者拥有足够的时间。快速数据处理可以将处理时间缩短几个百分点,但正如您的数据团队会告诉您的那样,任何分析的计算要求只是整个方程式的一部分。数据准备过程、寻找正确的数据集、模型构建和管理以及生产工程开销在障碍列表中显得尤为突出。
即使在投入大量时间和资源之后,也无法保证会产生任何有意义的结果 - 有时,您拥有的数据根本无法提供您想要的答案。不幸的是,意识到数据不正确或者问题是错误的,可能需要几周或几个月的时间才能弄清楚。
我们最近采访了佩吉·罗伯茨,开源关系经理垂直的,关于组织如何解决其中一些问题,并减少机器学习模型开始为企业提供数据库内机器学习产生实用且有用的结果所需的时间 Paige 强调了大数据项目遇到的一个常见问题,即数据集的大小与 R 和 Python 等许多数据科学工具的局限性之间的不匹配。许多工程师会抽取数据样本在本地进行处理,执行数据准备步骤,并使用它来训练模型。 “你甚至无法将 500 GB 的数据放在笔记本电脑上玩;它不起作用。没有足够的内存来处理它,而且速度非常慢。你必须提取一些数据的小样本并使用它。而如果你有一个基于集群的数据库,并且有 10 TB 或 100 TB 的数据,你会执行完全相同的 SQL 或 Python 命令,并且机器学习算法会查看所有数据。”
整合和准备数据、训练、评估和管理模型的步骤越复杂,结果就越慢——除非数据团队有幸拥有方便的并行计算集群,例如可以在内部执行机器学习工作的分布式数据库。
从本地笔记本电脑上的样品到生产,存在很多传统障碍。 Paige 举了一个例子:当一位数据科学家用少量数据样本创建了模型后,将模型交给数据工程师将其投入生产。 “然后,数据工程师必须重新开始,并使用 Spark 等技术为公司的整个数据集大规模重新创建所有这 100 个数据准备步骤。这可能需要三到六个月到一年或更长时间。我认为六个月通常是平均时间。这对于成功的数据科学项目来说是必要的。只是为了跨越最后一个障碍,从——我已经准备好一个模型——到真正为公司赚钱的地步。”
对于注重项目盈利的公司来说,一年是一段很长的时间。在某些时候,研究需要渗透到生产中,并且要迅速进行。否则,就好像机器学习作为一门学科从未离开过学术界。
尺寸问题
积累大量数据的不仅仅是大型企业。即使是小型初创公司也可以拥有数十亿字节的原始信息,这些信息可以(也许应该)产生巨大的价值。一些分布式分析数据库提供免费版本,或者为拥有大量数据的初创公司提供延长的免费所有权期限。在您的公司开始运营之前免费使用功能强大的软件是有意义的,然后在您的公司发展到需要更多容量或需要企业级支持时付费。
佩奇是一位社区爱好者。 “我们的社区用户可能是我们最有价值的资源,”她说。事实上,她公司的许多客户都开始下载 Vertica 的免费社区版并开始使用。
“我们的社区版内置了全部 650 多项功能。[顺便说一句,它仅限于三个节点和 1TB 数据 – Ed..]您可以使用付费 Vertica 完成的任何操作,都可以使用社区版完成,只是规模较小。”
请继续关注本系列的下一篇文章,我们将重点介绍 Vertica 的业务优势,或者您也可以下载公司的社区版。 (还有 Vertica Accelerator 的试用版,这是一种新的 SaaS 选项。)
