数据科学家:在实际工作后,我深刻认识到的五点

简介:

我从事数据科学工作了已经将近半年了,我一路上成长了很多,也犯了很多错误,并在这一过程中从学习了很多。

不存在没有失败,只有反馈。而现实世界就是一种反馈机制。

是的,学习之旅并不容易。我们该做的就是继续努力,不断学习和改进。

通过这段时间的学习历程,我发现在从事数据科学领域时,大多数初学者可能会遇到一些常见的问题。在本文中我总结出当中最需要注意的五点,希望能帮助你更好地进行数据科学之旅,让我们开始吧!

1. 业务领域知识

在刚开始从事数据科学工作时,这一点让我最印象深刻。一开始我并没有意识到领域知识的重要性。相反,我花了大量时间用于提高技术知识,在不真正了解业务需求的情况下去构建复杂的模型。

a9889aa60ca9bedfe01f6fa9b46ba6fbe06f6e6b

如果不彻底了解公司业务,你的模型很可能不会为公司增加任何价值,因为它无法满足公司的商业目的,无论你的模型有多精确。

提高模型精度的最常用技术是网格搜索,用于搜索模型的最佳参数。但是,只有在了解业务需求,并添加相关功能训练模型的前提下,这样才能显著提升模型性能。同时,功能工程也非常重要,网格搜索只是改善模型的最后一步。

与此同时,你需要关注公司的业务,因为你的工作就是通过数据帮助公司解决问题。不妨问问自己,你是否对公司目前的业务感兴趣。

仅仅了解业务本身是不够的,你还需要阐述自己的想法,并把相关内容用容易理解的术语表达给其他公司高层以及同事。

换句话说,不要只用其他人不熟悉且晦涩难懂的专业术语,这样只会引起不必要的误解。

有时尽管你的分析见解是正确的,但也可能受到他人的质疑。因此在展示如何用数据解决业务问题之前,建议你先表明自己对整个业务的了解,然后确定问题可用现有数据进行回答。

2. 细致的思维模式和工作流程

就像侦探一样,你需要注重细节。这在数据清理和转换过程中尤为重要。现实世界中的数据很混乱,你必须能够在数据的汪洋大海中找到所需的数据进行分析处理。

因此,具有以细节为导向的思维模式和工作流程对于在数据科学领域取得成功至关重要。如果没有一丝不苟的心态和严谨的工作流程,你可能会在探索数据的过程中失去方向。

你可能会在进行了一段时间探索性数据分析后,但仍未获得任何见解;你可能会不断地用不同参数训练模型,希望得到改进;你可能好不容易完成数据清理,而实际上数据却不够干净,无法提供给模型。

曾经我也经历过这些过程,后来我意识到自己缺乏结构良好的工作流程,而且内心急于求成。

最后我所做的是退后一步,从全局把握问题。并且重新梳理想法和工作流程,努力使一切都标准化和系统化。最终这奏效了!

3. 实验设计和逻辑

系统的工作流程能够为整个数据科学系统提供宏观的角度; 实验是工作流程中不可或缺的一部分,它包括假设测试和建模的过程。

Kaggle竞赛等机器学习问题相对简单直接些,你能从中获得训练数据并开始构建模型。

然而在现实情况比较复杂,你需要通过构建逻辑和设计实验来测试你的假设,并使用合适的指标评估模型。

在实验结束时,你的任何结论都需要事实和数据的支持,永远不要没有验证其有效性的情况下得出结论。

4. 沟通技巧

如果本文只能强调一点,那么我希望你能提高自己的沟通技巧。无论你是数据科学的初学者,还是数据科学专家。

ee1d8404036b5089b4de8cb991b1ec58590e843e

当在表达自己看法的同时,你需要聆听他人的意见,并且能够接受批评和反馈。

在与公司领导层和同事沟通业务时,要用简单易懂的语言。这与第一点提到的业务领域知识一样,如果缺乏这点会降低与团队成员的沟通效率,因为他人可能很难理解你想表达的内容。

更糟糕的是,缺乏沟通技巧会让领导层难以理解你的分析结果。即使你的分析很复杂,但始终要用简单的方式传达你的想法和建议。

5. 用数据讲故事

25297404fb629b77c0745fa4eea83035aacdb8c2

数据科学不仅仅是进行数据处理和建模模。凭借能够满足业务需求的出色模型,你最终目标应该是通过数据讲故事,把分析结果传达给公司领导层,当中需要能回答以下问题:

 ●   为什么我们要分析它?
 ●   我们可以从结果中获得什么见解?
 ●   我们可以做出哪些决策或行动计划?

用数据讲故事既简单又复杂。在数据驱动的分析中,有时即使是出色的模型和分析见解,也会因为糟糕的展现形式而变得毫无用处。这实在太可惜了!

想象一下你是公司领导,当数据科学家给你展现了能够出色解决业务问题的模型,而不做进一步解释。你可能会想,这很厉害,模型很在赞。那然后呢?

问题在于,模型结果和行动计划之间没有联系起来。即使你展示了高度精确的模型预测,而其他人却不知道该做什么。我们必须从他们的角度来思考,而不是仅仅满足业务目标。

有许多方法能够改善这一情况,我将简要介绍两种方法,它们可以提供启发性的见解并更好地制定行动计划。

4a40ebe372aedc61e129071d21d18d2b08b2a4a0

设置比较基准

良好的模型没有对比是不够的。换句话说,需要基准让我们知道模型是否达标。

如果没有基准,那么是不够的,容易出现质疑:怎样才能被认为是足够好?我为什么要相信你的结果?

风险管理

这一点尤为重要,因为它将决定你的模型是否会投入生产。这意味着你必须从模型性能中显示最佳和最差的案例场景。

这就是风险管理的用武之地,因为公司高层希望知道模型的局限在哪儿,当模型投入生产时公司要承担多大的风险,这最终会影响行动计划。

因此,风险管理不仅会使你的结果更具吸引力,而且还会提高公司利对你的信心。

谢谢你的阅读,希望这五点能够对你的数据科学之旅中有所帮助。


原文发布时间为:2018-10-18

本文来自云栖社区合作伙伴“CDA数据分析师”,了解相关信息可以关注“CDA数据分析师”。

相关文章
|
3月前
|
芯片
2023年的技术总结和工作反思
一、回顾2023年 回顾自己的2023年,还是发生了很多的变化。在大学毕业,就来到了芯翼参加工作,在这里也遇到了很多的前辈和小伙伴,收获工作的同时也收获了友情。但是,随着公司发展战略的变化,公司的人员架构也变额很多,对于我们刚毕业的大学生也变得越来越不友好,其实我也清楚这就是社会的发展现状。 其实,这不是我最终产生离职想法的结果,最终让我决定离职的是公司新来的人事主管十分的不理解我们,总是处处针对我们,这对于专心搞技术研发的我们来说,无疑是一个定时炸弹,让我们觉得自己的工作没有意义,甚至是没有成绩和结果,总是挂在嘴边的KPI考核也是越来越严格,总是觉得刚毕业的大学生的能力不行之类的,话说谁
43 1
|
7月前
|
开发框架 Java .NET
工作这么多年了,我为什么还在考证
毕业以来参加工作后,一直以来认为考证没有啥用处。一方面,因为找工作太过顺利,那会儿找工作也没有看到别人拿什么证去找工作,也没有看到那家公司的招聘广告上写需要什么什么证书。另一方面,由于才从学校出来对于学习考试有种天然的排斥。想想这么多年以来一直都是在学习考试。好不容易毕业了那还不好好放松一下。现在回想起来真是too young,too simple!
202 1
|
8月前
|
SQL
工作中的成长是从摆脱低水平勤奋开始的吗?
成长的本质是自我革新,成长就是在不断变化中的积极面。深度思考、目标设定、自律实践、持续学习、总结反思等步骤可以帮助我们成长,同时也需要避免陷入低水平勤奋的陷阱,不要忙于行动而忽视了反思和学习。
101 1
关于认知(高效能人士的七个习惯,刻意练习,PDCA,GTD)
关于认知(高效能人士的七个习惯,刻意练习,PDCA,GTD)
|
程序员 数据库
以终身成长的角度看待程序员的工作
随笔分享!欢迎留言交流!
103 0
以终身成长的角度看待程序员的工作
|
机器学习/深度学习 人工智能 算法框架/工具
机器学习应用行业浮躁、产品差?身为工程师的你是否想转行
十几个小时前,一位机器学习工程师在 reddit 上发帖求助:ML 领域浮躁、门槛低、产品差,无法专心做东西,该不该换个领域?帖子一经发布,立刻引起了大量讨论。
101 0
机器学习应用行业浮躁、产品差?身为工程师的你是否想转行
|
数据库
给软件工程师、数据科学家和数据工程师的面试指南:该做与不该做
7月9日 19:00-21:30 阿里云开发者社区首场“Offer 5000”直播开启!15位团队技术大牛在线招人,《阿里云技术面试红宝书》助你拿下Offer!马上投递简历:https://developer.aliyun.com/special/offerday01,在此,小编奉上数据库面试指南
1311 0
给软件工程师、数据科学家和数据工程师的面试指南:该做与不该做
|
运维 数据安全/隐私保护