大数据时代人文社会科学如何发展

当前,科学数据在科学研究中的作用日益显著,数据密集型知识发现方法受到科学界的普遍关注:科学家不仅通过对大量数据实时、动态地监测与分析来解决科学问题,更基于数据来思考、设计和实施科学研究。数据不仅是科学研究的结果,且成为科学研究的基础;人们不仅关心数据建模、描述、组织、保存、访问、分析、复用和建立科学数据基础设施,更关心如何利用泛在网络及其内在的交互性、开放性,利用海量数据的可知识对象化、可计算化,构造基于数据的、开放协同的研究与创新模式。在人文社会科学领域,以“人文计算”、复杂网络分析、大规模数据分析为特征的研究方法逐渐被采纳,人文社会科学的“科学性”显著增强,而批判性与人文关怀有所弱化,学界对此褒贬不一。

人文社会科学研究的数据挑战

其一,科研资料总量的快速增加给人文社会科学学者带来了巨大挑战。2006年,Gregory Crane提出,当前人文社会科学研究者在自身研究领域都面临大量文献资料的处理,这些文献资料的数量已经大大超越了传统阅读能力所能处理的范畴,因而人文社会科学学者也将不得不借助计算机来处理完成相关文献资料,即“百万图书的挑战(Million Books Challenge)”问题。随着跨学科研究趋势的日益增强,传统人文科学和社会科学领域引入了大量的计算机处理模式和分析方法,各类依托计算机存储媒介数字学术资源的开发,基于复杂运算和分析的计算机模拟与实证,基于事实与证据的商业预测与案件证据推理等研究议题广泛兴起,从根本上改变了人文知识的获取、标注、比较、取样、阐释与表现方式。尤其在语言学、文学、历史学、文艺学、民族学等多个人文领域取得了引人注目的效果,并组建了专门的科研机构,形成了国际数字人文机构联盟和数字人文中心网络两大数字人文研究联盟。

大数据时代人文社会科学如何发展

其二,资料的数字化改变了传统人文社会科学的资料类型,数字资源的采集、加工和处理对研究成果的获得作用日益显著。目前,海量的图书、报纸、期刊、照片、绘本、乐曲、视频等人文资料被数字化,并在互联网上被提供给研究者存取利用。而以“大数据”为代表的数据资源相对于数字文本、数字文献等数字信息资源,来源更加广泛,数据粒度更小,记录单元更加碎片化,结构更加多元化,机器生成数据也显著多于人工生成数据,信息质量参差不齐,对资料的汇集、保存和综合利用更加依赖计算机的辅助,人文社会科学也越来越需要依赖计算机对研究过程的支撑,传统人文社会科学学者对计算机技术和分析技巧的缺失甚至可能影响人文社会科学研究的最终实现,进而将计算机分析处理能力延伸为人文社会科学研究者科研素养的重要组成部分。

大数据与人文社会科学研究新思维

从当前数字人文和人文大数据研究情况看,人文及社会计算方法与人文社会科学研究的融合出现了三类新的研究思维:

其一,人文社会科学开放与全过程研究思维。以往人文社会科学研究成果的表现形式为最终成果,再利用主要以文献引用、转述和评论等为主。而数字人文研究可记录人文社会科学研究的完整过程,资源化的原始数据、中间成果得以立体化应用,再利用水平显著提升。目前,国外以在线实验室、项目网站、开放数据集、项目论坛、项目社会网络为特征的立体开放研究思维普遍确立,可参与性大大增强。

其二,人文社会科学碎片化重组研究思维。大数据环境下,人文社会科学研究更加注重片段数据、海量数据、非结构化数据的采集、清洗与分析,通过碎片化重组,深度揭示难以处理或无法预知的科学问题。比如通过海量自然语言表达效果观测公众的政治参与意识、通过科学家的在线时间与资源下载时间分布研究科学家的作息时间与工作强度等。

其三,人文社会科学计算分析研究思维。以往人文社会科学研究定性研究居多,定量研究也主张采用是非论断,采纳或拒绝某一特定假设,是采用确定性、因果关系的研究思维。在大数据环境下,人文社会科学研究可采用计算分析思维,对相关命题进行趋势分析。

此外,在上述研究思维体系下,跨学科协作、跨平台协作、海量资料加工以及人文社会科学的计算化趋势日益明显,并涌现出若干研究取向与热点问题。

人文社会科学大数据研究的基本特征

综合已有的研究,人文社会科学的大数据研究具有如下基本特征:

一是所涉及资料均大大超过一般的阅读、分析和理解所能处理的范畴,是以往“不可研究”或“难以研究”的,大数据分析方法的出现提供了人文社会科学研究新的研究空间,提供了新的研究可能。

二是一般引入计算分析方法,其结论并非观察、思索、领悟等传统方法获得,而是通过大量数据的汇集而“自动涌现”,其理论的获得不同于传统人文社会科学研究。

三是均构建了可持续完善和丰富的数据集和分析工具,其可用性、共享性、重用性、协作性大大增强,提供了人文社会科学学者大规模协作的可能。

四是均具有跨学科特征。数字人文研究需要汇集专业领域技能、数据管理技能、数据分析技能和项目协作技能,因而这类项目往往由跨度较大的不同学科的专业学者共同完成。

五是决定研究质量的主要是数据集的质量、数量和利用方式,而研究假设相对容易。在某种程度上,数据科学家将成为人文社会科学大数据研究中的主角。

人文社会科学大数据研究的隐忧

虽然以微软、谷歌、IBM为代表的主流数据服务商都极力推崇数字化人文社会科学研究的美好前景,但其也存在不足:

首先,非场景化的研究逻辑缺乏适用性与人文关怀。由于完全剥离了数据所处的具体环境,数据可能生涩,并且缺乏可理解性和适用性。比如商业分析中的数据挖掘,其可用性仅10%左右,并非“一挖就灵”。2012年,加拿大作家史蒂芬·马尔什在其文章《文学不是数据:反对数字人文》中也表示,将文学当作数据会失去文学本身丰富的意蕴。

其次,人文社会科学的大数据研究有可能“敏锐地”发现问题,却无法给问题合理的解释,也无法给出有针对性的对策,限制了其应用范围。比如舆情分析、政策计算、情感计算的应用。

再次,数据分析的集群研究会消灭重要的个体特征,而个体反而是众多人文社会科学研究关注的焦点。

最后,人文社会科学大数据研究过分关注技术分析,可能忽视创新思维和思辨分析,不利于大师级人文社会科学学者的培养。

总之,随着人文社会科学数据的快速增长以及大数据分析技术的日益完善,人文社会科学的大数据研究必然会成为人文社会科学的主流领域,但不会替代现有的人文社会科学研究,而是相互补充,相得益彰。

(孙建军  作者为国家社科基金重大项目“面向学科领域的网络信息资源深度聚合与服务研究”首席专家、南京大学教授)

(责任编辑:mengyishan)

时间: 2024-09-24 00:04:19

大数据时代人文社会科学如何发展的相关文章

大数据时代企业投融资创新发展

大数据时代企业投融资创新发展的问题,涉及许多前沿科学技术问题. 上世纪90年代初,我在中央党校读博期间,研究决策科学,和它包含的认识论.如何依据有效信息,科学作出决策.当时主要接受了美国西蒙教授的理论,他是一位诺贝尔经济学奖得主,提出了"有限理性"理论,认为人的理性是有限的,只能从有限的信息量中,寻找相对好的决策.比如,要买一枝鲜花,并不需要跑遍所有的花店;要找一个合适的爱人,并不需要与全世界的女人谈一遍恋爱.差不多就行了. 我同意这种观点,但说差不多就行了,未免有点过于悲观和消极,而

国双续扬:大数据时代的新媒体发展

文章讲的是国双续扬:大数据时代的新媒体发展,最近两年, 有一些行业趋势在非常明显,用关键词来总结就是:大数据.OTT.多屏互动.大数据是从互联网和IT领域发展起来的一个专业术语,它存在于各个领域.各行各业;而"OTT"."多屏互动"是广电行业的专业术语,但它们和大数据有关,和广大受众的媒体体验更是密切相关. 第一个关键词是大数据,可以说这是眼下整个TMT行业的大背景.互联网发展到今天,生产.存储.积累的数据量之大,已经超越了一般人所能想象的范围.数据让人们不仅能掌握

大数据时代继续教育深化发展的机遇与挑战分析

美国人舍恩伯格曾在<大数据时代>中提到,2013年将是大数据时代元年,意味着信息科学技术的发展开始步入新的发展时代.继续教育作为终身教育中的一个重要组成部分,是建立在初始教育基础上的职后教育,已经被越来越多的人所重视.在大数据时代背景下,继续教育如何抓住机遇.迎接挑战,已经成为广大继续教育研究者关注的焦点. 一.大数据时代继续教育深化发展的重要性 1.大数据界定维度 当前,关于大数据的界定主要有三种,即分别从数据体量方面.复杂性方面.价值方面对大数据进行界定. 在数据体量方面的界定最早由麦肯锡

安防大数据时代的IP摄像机发展

前言 根据全球最具权威性的调查机构IHS的调查显示,2015年,全球市场的IP摄像机出货量和销售额都超越了模拟摄像机.2015年成为了IP全面超越模拟的转折之年,IP的大时代至此真正来临.与此同时,IP产品的快速普及,也为安防大数据(SDT)的进一步应用积累了大量的原始数据和技术基础.那么,当IP化大浪潮遇见安防大数据后,会碰撞出怎样的火花?下一个十年.二十年,IP摄像机会朝着哪些可能的方向发展呢? 高清先行,为实用化智能应用铺路 高清是IP摄像机在近几年快速扩张普及的一个很重要的因素.从标清到

大数据时代CPI调查如何发展

伴随着社会各界对CPI(居民消费价格指数)关注度的日益升温,互联网的高速发展,一个以信息爆炸为特征的大数据时代正在到来.这对CPI调查工作提出更多的要求和挑战,积极探索如何应对大数据时代的到来,实现CPI调查与时代接轨已成为当务之急. CPI调查存在的问题 一是调查对象不配合现象时有发生.价格调查中对鲜活商品等部分规格品要求"逢五逢十"采价,采价频次较高.调查范围较广,因而在与农贸市场摊主.商家等频繁接触过程中,采价遭遇"闭门羹"现象时有发生. 二是部分采价原则较难

大数据时代零售企业如何进行精确营销

近年来,同质化商品.频繁的价格战.店铺租金上涨.电子商务的冲击等因素导致零售企业利润不断下降,在2015年出现了零售业关店潮这一现象,大量零售门店关门,2016年还在延续.但是,有人倒下,就有人站出来.在当今大数据时代,谁能顺应时代的改变进行改革,谁就能抓住新的发展机遇. 零售企业通过多年的运营,掌握了大量的一手数据资料,如果能从这些数据中发现其的价值,掌握消费者的消费行为规律,预测消费者的购买意图,从而有针对性地制定精确的营销策略,消费者将感受到企业对他们的关注,降低营销成本的同时能改善消费者

大数据时代下的信息安全

这几年大数据时代越来越快速的发展,"棱镜门"也让信息安全成为重要课题,在个人信息安全方面,下文将分享一些方法. 个人应存三套密码,分开使用 如今的互联网已经在我们的日常生活中随时相伴:想要购物,通过网络购物足不出户就能买到全世界任何产品:想要与大洋彼岸的朋友交流,通过网络即时通讯工具就能够实现即时交流并讨论工作:通过网络我们还能够和朋友分享美食美图和心情. 但是,在互联网越来越多的出现在生活中,同时也陆续爆出诸如"天涯社区4000万用户信息泄露"事件."搜

大数据对都市媒体转型发展的意义与影响

新的时代总会产生新的词汇,例如微博.微信.朋友圈等等,而如今,大数据则是目前最热的词汇之一.大数据究竟是什么?该如何利用好它?对于长期在编采体系工作.并无更多广告经营经验的媒体工作者来说,这是一个值得研究的现实课题.以下是笔者对此的一些看法和理解,以及在编采实际工作中的应用设想. 一.大数据是什么 套用现在最为流行的话而言,一个人的成功并不唯一取决于他的智商和天赋,更取决于他的情商:而一个人的成就与他的人脉有着很大的关系,没有人脉,没了圈子,就没有了用武之地.而大数据,其实就是这样一个各个行业未

PureData专家力量成就大数据时代价值

本文讲的是PureData专家力量成就大数据时代价值,在人类发展的历史上经历过几次大的变革阶段,这是今天人们有目共睹的.第一个阶段,人类语言的产生;第二个阶段,铁器时代的到来;第三个阶段,印刷术让人类文明能够得到承载;第四阶段,19世纪利用电磁波技术传播信息的时代,加速了信息传播的速度和广度;第五个阶段,二十世纪开始的新变化,数据的变化. 有一个触目惊心的数字对比能够充分展现人类进步的速度."近3500年人类文明发展所产生的数据放到今天,大约等于我们这个世界两天所产生的数据." IBM