大数据技术面临的三个重要技术问题

大数据技术面临的三个重要技术问题,我们一起来看看。当今,大数据的到来,已经成为现实生活中无法逃避的挑战。每当我们要做出决策的时候,大数据就无处不在。大数据术语广泛地出现也使得人们渐渐明白了它的重要性。大数据渐渐向人们展现了它为学术、工业和政府带来的巨大机遇。与此同时,大数据也向参与的各方提出了巨大的挑战,首先是大数据技术面临的三个重要问题:

一、如何利用信息技术等手段处理非结构化和半结构化数据

大数据中,结构化数据只占 15%左右,其余的 85%都是非结构化的数据,它们大量存在于社交网络、互联网和电子商务等领域。另一方面,也许有 90%的数据来自开源数据,其余的被存储在数据库中。大数据的不确定性表现在高维、多变和强随机性等方面。股票交易数据流是不确定性大数据的一个典型例子。

大数据刺激了大量研究问题。非结构化和半结构化数据的个体表现、一般性特征和基本原理尚不清晰,这些都需要通过包括数学、经济学、社会学、计算机科学和管理科学在内的多学科交叉来研究和讨论。给定一种半结构化或非结构化数据,比如图像,如何把它转化成多维数据表、面向对象的数据模型或者直接基于图像的数据模型?值得注意的是,大数据每一种表示形式都仅呈现数据本身的侧面表现,并非全貌。

如果把通过数据挖掘提取 “粗糙知识” 的过程称为 “一次挖掘” 过程,那么将粗糙知识与被量化后主观知识,包括具体的经验、常识、本能、情境知识和用户偏好,相结合而产生“智能知识”过程就叫做“二次挖掘”。从“一次挖掘”到“二次挖掘”类似事物“量”到“质” 的飞跃。

由于大数据所具有的半结构化和非结构化特点,基于大数据的数据挖掘所产生的结构化的 “粗糙知识”(潜在模式)也伴有一些新的特征。这些结构化的粗糙知识可以被主观知识加工处理并转化,生成半结构化和非结构化的智能知识。寻求 “智能知识” 反映了大数据研究的核心价值。

二、如何探索大数据复杂性、不确定性特征描述的刻画方法及大数据的系统建模

这一问题的突破是实现大数据知识发现的前提和关键。从长远角度来看,依照大数据的个体复杂性和随机性所带来的挑战将促使大数据数学结构的形成,从而导致大数据统一理论的完备。从短期而言,学术界鼓励发展一种一般性的结构化数据和半结构化、非结构化数据之间的转化原则,以支持大数据的交叉工业应用。管理科学,尤其是基于最优化的理论将在发展大数据知识发现的一般性方法和规律性中发挥重要的作用。

大数据的复杂形式导致许多对 “粗糙知识” 的度量和评估相关的研究问题。已知的最优化、数据包络分析、期望理论、管理科学中的效用理论可以被应用到研究如何将主观知识融合到数据挖掘产生的粗糙知识的 “二次挖掘” 过程中。这里人机交互将起到至关重要的作用。

三、数据异构性与决策异构性的关系对大数据知识发现与管理决策的影响

由于大数据本身的复杂性,这一问题无疑是一个重要的科研课题,对传统的数据挖掘理论和技术提出了新的挑战。在大数据环境下,管理决策面临着两个 “异构性” 问题:“数据异构性” 和 “决策异构性”。传统的管理决定模式取决于对业务知识的学习和日益积累的实践经验,而管理决策又是以数据分析为基础的。

大数据已经改变了传统的管理决策结构的模式。研究大数据对管理决策结构的影响会成为一个公开的科研问题。除此之外,决策结构的变化要求人们去探讨如何为支持更高层次的决策而去做 “二次挖掘”。无论大数据带来了哪种数据异构性,大数据中的 “粗糙知识” 仍可被看作 “一次挖掘” 的范畴。通过寻找 “二次挖掘” 产生的 “智能知识” 来作为数据异构性和决策异构性之间的桥梁是十分必要的。探索大数据环境下决策结构是如何被改变的,相当于研究如何将决策者的主观知识参与到决策的过程中。

大数据是一种具有隐藏法则的人造自然,寻找大数据的科学模式将带来对研究大数据之美的一般性方法的探究,尽管这样的探索十分困难,但是如果我们找到了将非结构化、半结构化数据转化成结构化数据的方法,已知的数据挖掘方法将成为大数据挖掘的工具。

本文作者:佚名

来源:51CTO

时间: 2024-09-30 02:39:54

大数据技术面临的三个重要技术问题的相关文章

解读大数据技术面临的三个重要技术问题

大数据技术面临的三个重要技术问题,我们一起来看看.当今,大数据的到来,已经成为现实生活中无法逃避的挑战.每当我们要做出决策的时候,大数据就无处不在.大数据术语广泛地出现也使得人们渐渐明白了它的重要性.大数据渐渐向人们展现了它为学术.工业和政府带来的巨大机遇.与此同时,大数据也向参与的各方提出了巨大的挑战,首先是大数据技术面临的三个重要问题:   一.如何利用信息技术等手段处理非结构化和半结构化数据 大数据中,结构化数据只占 15%左右,其余的 85%都是非结构化的数据,它们大量存在于社交网络.互

大数据架构面临技术集成的巨大障碍

企业可以利用Hadoop以及所有与它相关的技术设计大数据环境,以满足其特定的需求.但把所有的技术集成在一起并不是一件容易的事. IT团队寻求构建大数据架构时有大量的技术可供选择,他们可以混合搭配各种技术以满足数据处理和分析需求.但是有一个问题存在:把所有需要的技术框架组合到一起是一项艰巨的任务. 在不断扩展的Hadoop生态系统中,选择和部署合适的大数据技术是一个长期反复的过程,周期要以年计.除非公司管理者愿花大量财力和资源来加速推动项目.选择技术的过程中有失误判断是很常见的,一家公司的架构蓝图

大数据时代结构化存储云HBase技术架构及最佳实践

在10年,阿里研究HBase,是为了解决阿里容量及并发的实际问题,按照数据库要求,阿里深入HBase技术,并致力于保障稳定性和性能,目前已经有10000台规模,数百个集群,大约1亿的QPS,服务整个集团的业务.17年,把这部分能力也开放给公有云客户.本文中,阿里云高级专家封神带来了主题演讲<大数据时代结构化存储云HBase技术架构及最佳实践>,介绍HBase的应用选择.实战案例.技术平台解读以及后续的规划. 为什么应用HBase 一般而言,传统关系型数据库面临着成本.容量.QPS.分析等多方面

盘点全球最热十家大数据公司中国占三席

文章讲的是盘点全球最热十家大数据公司中国占三席,近两年来,大数据发展浪潮席卷全球.研究机构IDC预测,全球大数据与分析市场规模将由2015年的1220亿美元,在5年间成长超过50%,并在2019年底达到1870亿美元的规模.资本也敏锐地追逐着高增长市场.数据显示,美国在2013年大数据领域的新创公司就获得了36亿美金(200多亿人民币)的投资,硅谷大数据公司Palantir更是获得高达200亿美金的估值. 对于被大数据概念包围的人们来说,理解大数据趋势和价值的最有效的办法就是了解最优秀的大数据创

盘点全球最热门十家大数据公司中国占据三席

近两年来,大数据发展浪潮席卷全球.研究机构IDC预测,全球大数据与分析市场规模将由2015年的1220亿美元,在5年间成长超过50%,并在2019年底达到1870亿美元的规模.资本也敏锐地追逐着高增长市场.数据显示,美国在2013年大数据领域的新创公司就获得了36亿美金(200多亿人民币)的投资,硅谷大数据公司Palantir更是获得高达200亿美金的估值. 对于被大数据概念包围的人们来说,理解大数据趋势和价值的最有效的办法就是了解最优秀的大数据创业公司.接下来我们就来盘点全球最热门的十家大数据

电信行业大数据应用的后盾 MPP架构数据库技术

ZDNet至顶网软件频道消息:在大数据时代,数据呈爆炸式增长,单个SMP系统已经无法应付数据增长所带来的巨大压力.随着网络技术的发展,PC服务器的"小型化"以及Linux系统的成熟,基于MPP架构的新一代数据库技术成为各行业用户的首选.电信行业作为国家重点行业,引领着IT技术的发展方向和潮流,在高并发业务处理.海量数据分析等领域有着迫切需求,而MPP数据库技术作为未来主流的数据库技术,通过分布式并行计算.动态扩展等技术,能够在大规模事务处理和大数据分析等多种场景,满足电信业务需求,提升

洪小文撰文: 人工智能正在与机器学习、大数据构成一个足以改变未来的技术“铁三角”

雷锋网(公众号:雷锋网)按:继<我们需要什么样的机器人>之后,微软全球资深副总裁.微软亚太研发集团主席兼微软亚洲研究院院长洪小文再一次亲手撰写文章,与我们进一步分享了他对人工智能的见解与洞察--<HI+AI:人机协同 赋能未来>. <机器会产生自我意识吗?>是<HI+AI:人机协同 赋能未来>三篇系列文章的下篇.在本文中,洪小文博士以"中文房间"为例子,告诉我们现阶段的人工智能还很弱,离实现强人工智能还很远.而眼下,HI+AI.人类创意无

企业部署大数据需要注意的三个陷阱

文章讲的是企业部署大数据需要注意的三个陷阱,大数据带来了巨大的机会,但是新手在部署大数据时经常出现一些问题,需要有经验的专业人士答疑解惑.根据Frost&Sullivan咨询公司的一份研究报告显示这些问题主要表现在以下三个方面:即不完整的数据收集.项目延期和资源匮乏. 事实上,这些问题已经非常普遍,同时给行业带来了巨大的风险,组织部署大数据急需专家的技术支持."相比企业自身解决,寻求专家的帮助将有效的帮助企业降低成本."Frost&Sullivan研究报告<The

大数据发展迅猛 基金三主线掘金

文章讲的是大数据发展迅猛 基金三主线掘金,9月5日,国务院印发<促进大数据发展行动纲要>,大数据行业顶层设计正式出炉.<纲要>部署近5年至10年大数据发展的三大主要任务,分别是政府数据资源开放.推动产业创新培育新兴业态及健全大数据安全保障体系.同时,明确统筹协调.法律法规.数据安全与保护.财政金融支持.人才培养.国际交流合作等七方面政策机制.到2020年,我国将形成一批具有国际竞争力的大数据处理.分析.可视化软件和硬件支撑平台等产品,并培育10家国际领先的大数据核心龙头企业.在行业