12.26 基于众包的数据提纯
随着基于位置服务的蓬勃发展 , 随之出现了大量相关的空间文本数据。空间文本数据包括两方面信息,一个空间位置信息 , 通常与一个空间兴趣点相关,由一个经纬度坐标点表示数据所处的地理位置;一个文本信息,通常是由一组关键词构成的类似标签的文本描述。目前,这些关键词标签的生成方式主要通过人工添加与机器算法自动生成,由于来源广泛,这些生成的关键词质量参差不齐,很多质量难以保证。这些错误的数据在实际应用中将带给用户非常糟糕的体验,甚至误导用户,造成损失。比如当前很多基于位置的服务通过关键词标签为用户提供兴趣点推荐服务,若兴趣点的标签是错误的,那会给用户带来极大的困扰。由此很多产生的空间文本数据很难在实际中使用。 为有效缓解这一问题,本文研究基于众包的空间文本数据提纯问题,通过众包方法优化收集到空间文本数据的关键词,排除其中错误不合理的关键词。
众包是这几年兴起的通过人力智慧解决问题的可靠途径。 很多计算机难以有效解决的问题,如复杂的图片标注、实体一致性判断等问题都可以通过众包得以解决。通常任务会被发布到众包平台 ( 如MTurk、ChinaCrowds) 上,然后由众包工人参与解答任务。本文采用同样的方式,当一个空间文本数据作为任务被发布在众包平台上后,按照图 1(a) 的框架执行任务。任务针对的是真实的动态场景,首先有一个总的花费预算 ( 如工人回答任务的总数,即每个工人回答一个任务需要消耗一定金钱 ),然后工人陆续地分批请求任务,当某个工人提供答案后还可以继续请求任务。当一批工人请求任务时,有一个任务分配模块会为每个工人分配一定数量的任务,然后通过众包平台收集工人的答案,并交由一个推断模型来得到包括工人质量在内的中间信息。这些中间信息会进一步指导分配模块对下一波请求任务的工人进行任务分配。这个分配 - 推断的过程一直重复进行,直到预算全部花费完毕。这时由推断模型根据所有收集到的工人答案,推断出每个数据关键词是否正确合理。下面介绍并解决这一过程中需要处理的问题。