当前,学术期刊数字化、智慧化、移动化传播趋势明显,微博、微信公众号、视频号、App等新媒体建设更是如火如荼。新媒体平台的蓬勃发展改变了传统的学术传播模式,加快了传播速度,丰富了学术内容表现形式,拓展了知识服务范围,促进了学术共同体凝聚和交流,推动学术期刊内容生产和传播从“纸印本时代”“数字图书馆时代”发展到“服务平台时代”。
中宣部、教育部、科技部印发的《关于推动学术期刊繁荣发展的意见》指出,学术期刊要适应移动化、智能化发展方向,加强新媒体编辑力量和技术力量,推动数字化转型。但当前学术期刊新媒体建设仍然普遍存在信息来源单一、内容针对性不强、服务项目设置过少、用户关注度不高等问题,没有充分发挥出新媒体的巨大潜力。一项对高校学报的调查显示,99.3%的学术期刊没有利用大数据技术为用户提供有关信息服务。
数据挖掘是一种从大量数据中提取出有价值信息的过程,它通过应用统计学、机器学习和模式识别等技术,从数据中发现隐藏的模式、关联规律、趋势和知识,旨在利用这些发现作出有用的预测和决策。数据挖掘已广泛应用于商务、金融、医疗、市场营销、社交网络等领域,极大提高了工作效率和针对性。微博、微信、App等新媒体平台在运行过程中产生了大量的使用数据,如账号信息、阅读轨迹、阅读次数、点赞数、评论次数等,平台后台(日志)保存了这些数据的详细记录。通过对这些数据进行统计分析,可以获知用户需求、使用习惯、兴趣偏好等,从而提高新媒体平台建设的针对性。这是利用数据挖掘的初步阶段。更进一步,通过对文本的统计分析,可以从评论回复、社区讨论当中获取用户反馈、研究热点、研究趋势、学术评价等更多有价值的信息。结合更多的场景应用,以及学术期刊的融合发展,数据深度挖掘将有利于提高学术期刊新媒体平台建设质量,提升新媒体平台服务效能,扩大资源利用价值,丰富平台功能,链接用户需求,助力学术期刊高质量发展。
目前对于学术期刊新媒体平台建设的研究多集中于内容建设、用户服务、话语策略、运营策略、影响力提升等方面,如张家瑞的《高校学术期刊自媒体平台视听内容建设探究——以C9联盟高校学报微信订阅号为例》、邓婧等的《高校学术期刊微信公众号知识服务策略》、毛殷的《学术期刊微信平台论文阅读行为与移动传播策略》、郭小敏等的《科技学术期刊的短视频平台运营现状分析及策略探讨》、章诚的《学术期刊微信公众平台运营现状及提升策略》、韩宜轩的《学术期刊新媒体融合建设的挑战与策略》、谭春林的《公众号、视频号与微信群协同推动学术期刊的“主动传播”》等。专篇从数据挖掘角度对学术期刊新媒体平台建设进行探讨的研究不多,目前检索到的有于永丽的《基于用户画像的学术新媒体精准知识服务研究》、毕丽等的《自媒体后台数据分析在提升医学学术期刊传播力中的应用》、丛敏等的《优化学术期刊微信公众平台的服务——基于后台统计数据的研究》。这些研究对数据挖掘的利用尚处于局部范围,缺乏对新媒体平台数据全方位的、结合平台长远发展的深层挖掘和利用。
本研究拟探索数据深度挖掘技术在学术期刊新媒体平台建设中的应用途径和实施路径,探讨学术期刊新媒体平台更多的功能价值和应用场景,促进学术期刊与多种媒介深度融合,资源整合优化,服务链条延伸,整体实力增强以及传播影响力提升。
一、当前学术期刊新媒体平台建设存在的主要问题
新媒体平台具有学术期刊传统媒介所不具有的功能和优势,其产生和存储的各种数据即是有待开发和利用的重要资源。在传者中心的思维模式下,当前大部分学术期刊新媒体平台内容只是纸质期刊的简单复制,或是提供简单的读者服务,没有将新媒体平台作为一种新的办刊模式去经营。
(一)内容简单复制,建设千篇一律,缺乏用户需求分析
目前越来越多的学术期刊开通了微信公众号,根据《中国科技期刊发展蓝皮书(2021)》的数据,参与2020年度年检并填报了新媒体相关数据的4781种科技期刊中,有2541种期刊设立了微信公众号,占53.1%。而中国人文社会科学综合评价研究院的统计显示,CSSCI 来源期刊目录(2019—2020)收录的70种高校学报期刊中,62种已开设微信公众号,占88.6%。虽然学术期刊在拓展传播渠道方面不遗余力,但普遍存在内容简单复制,千篇一律的问题。大部分学术期刊公众号仅有期刊动态、论文推介、目录摘要、在线查询等栏目;每一期推送的论文编排与纸质刊完全相同,有的对单篇论文稍作提炼和加工,更多的则是原样复制。
学者的研究方向、研究专长、研究志趣本就千差万别,不同时期还有不同的阶段倾向和重点,即使是专业期刊也难以满足研究人员差异化、个性化的阅读需求。通过语义识别和知识图谱技术,目前学术知识服务已经从期刊、文章,细化到对知识点的抽取与整合。学术期刊微信公众号若仍是纸质刊的简单复制,不做用户需求分析,相同内容无差异地推送给所有用户,无疑将难以满足用户的多样化、个性化需求。微信平台能够记录用户的使用偏好和使用习惯,利用数据挖掘技术能更好地获知用户需求,为精准推送及个性化服务打下基础。
(二)平台数据没有充分利用,无法形成融合发展的良性互动
移动平台的学术阅读中,用户经常浏览哪些栏目,关注哪些研究方向和热点话题,分享了哪些方面的文章,参与了哪些讨论,在哪些文章上停留了较长时间、做了标记,等等,诸如此类的数据不仅可以反映个人的需求偏好,更为学术期刊编辑提供了选题策划及选稿组稿的重要参考依据。
当前实践中,首先,大部分学术期刊的微信平台由于没有着力经营,数据积累不够丰富;其次,即使建设较好的微信平台,对平台数据也缺乏重视,没有充分利用,数据成为闲置的“宝藏”。
真正意义上的深度融合出版不仅仅是技术上的进步以及数字媒介的加入,还应包括融入以用户为中心的经营理念,以及期刊工作模式的转变。具体到平台数据利用方面,海量数据为编辑选题策划提供了线索和依据,对这些数据的充分利用体现的是以用户为中心的思想。用户的使用数据促发编辑选题,组织新的内容生产;新的内容生产又引起新的话题和讨论,形成新的使用数据。
(三)社群建设力量弱,凝聚学术共同体力量不够强
新媒体平台除了移动特性之外,还具有强大的社交活动功能。而目前大部分学术期刊新媒体平台仅仅发挥了作为移动端的“阅读器”“发布站”的功能,社群网络和用户互动建设较为薄弱,凝聚学术共同体力量不够强。新媒体平台的社群建设涉及诸多方面,从数据挖掘的角度来说,平台大数据的挖掘和分析可作为社会影响力评价指标,助力新媒体平台的社群建设。平台上论文的阅读、转发、评价、回复等数据经过提炼分析,可作为学术论文后期同行评议的重要参考依据。这对于发挥平台学术共同体的力量,促进平台高质量的同行社群参与,提升期刊以及平台影响力等,无疑具有重要意义。
(四)平台功能单一,缺乏场景思维,移动平台特性不够凸显
众多学术期刊微信平台只是纸质刊的简单复制,或稍作加工,没有充分考虑微信作为移动传播平台的特性,缺乏从传播理念、内容建设、用户服务到运营模式的整体改革。王晓光等在《学术阅读智慧化:学术论文在线阅读系统优化研究》一文中将学术阅读分为三种任务、八种需求,即理解任务(文献比较、发现新问题/观点/主题、梳理研究进展、观点验证)、检索任务(获取特定信息)、积累任务(知识拓展、知识更新)。前两种阅读任务大致属于深度阅读,而积累任务多属于浅阅读。其实就目前手机阅读来说,主要满足的还是积累任务,侧重阅读的广度而非深度,要求信息及时更新,提供适宜移动阅读的使用体验,具备学术社交和互动功能。当前学术期刊的微信平台建设既没有考虑微信碎片化、移动化的时空场景使用特性,同时也缺乏场景与场景的互动融合,忽视了微信平台除了可以营造“阅读”的场景,还承担社交、支付、数据收集、虚拟购物、学术服务等多元化场景。
二、数据深度挖掘赋能学术期刊新媒体平台建设的可能性与可行性
数据挖掘是指通过统计分析、机器学习、专家系统(依靠过去的经验识别)等方法发现多源数据准备中的关键词隐藏的规律,已广泛应用于商务金融、市场营销、教育、医疗等领域。
学术期刊新媒体平台的快速发展为数据挖掘技术的应用提供了前期基础。微信等新媒体平台保存了用户的基本信息数据、行为数据、社交数据、内容数据等。以上数据结合不同的场景应用和不同的使用方向,可以扩大新媒体平台功能,丰富其价值内涵,优化学术期刊知识服务,增强办刊综合实力。
技术上,数据挖掘已经发展多年,有成熟的技术方法,也有专门的分析工具和从事此类工作的机构企业。常用的数据挖掘方法包括分类、聚类、回归分析、关联规则、决策树、社交(神经)网络分析等。除用户特征数据以外,文本分析技术能够分析文本的情感倾向,对于话题监督、口碑分析等较有价值。如运用自然语言处理技术等技术工具,可实现对文本数据的挖掘和分析。
三、数据深度挖掘赋能学术期刊新媒体平台建设的主要途径
传统办刊模式下,学术期刊只负责学术成果的出版和发布,而在互联网思维、以用户为中心的新的办刊模式下,学术期刊应借助新媒体平台优势,充分利用其数据资源及社交属性,发挥综合的知识服务功能,在学术传播中起到引领作用。从数据挖掘的角度来看,主要可从用户需求分析、编辑收集有用信息、助力平台社交功能发挥、拓展服务功能等方面探索其赋能新媒体平台发展的路径。
(一)用户需求分析
数字出版环境下,新媒体平台用户数据包括:1.用户基本信息。包括用户年龄、 性别、职业、教育水平、地理位置、兴趣爱好等。2.用户行为数据。包括购买行为、阅读/浏览行为、搜索行为、收藏行为、评论/评价行为、转发行为、点赞行为等。3.用户社交数据。包括好友关系、社区角色、分享数据、提及(@)数据、标签、新增粉丝、发表内容的活跃度等。4.用户内容数据。包括用户评论的关键词、用户关注的作品主题词、用户自己生产的内容信息数据(UCC内容)等。
掌握新媒体平台用户数据,学术期刊可以充分利用大数据技术,监测、统计、分析用户使用偏好,建立用户画像体系,根据用户个性化需求提供精准推送及个性化知识服务。另外,学术期刊可通过新媒体平台(微博、App、公众号、微信群、微社区、微论坛)与用户的互动情况,利用数据挖掘技术挖掘、分析、提炼用户所关注的研究热点问题和相关服务需求。
从海量数据中发现模式和规律,建立用户画像体系,实现精准知识服务,主要包括以下几个步骤:1.收集数据。有效数据包括用户基本信息数据和用户动态行为数据。有效数据应按越多越好的原则进行收集,足量的数据有利于后续数据挖掘算法分析及发现模式。2.数据处理与分析。主要指对数据进行清洗、整合、转换等操作,形成规范化的数据格式。应用数据挖掘中的序列相似度计算、关联规则挖掘等算法,对数据进行分类、聚类等处理和分析,提炼出每类受众的知识偏好。3.标签抽取。抽取关键短语或关键词生成用户标签。4.构建用户画像体系。对标签进行整合和分类,通过区分各标签集合的学科种类、教育水平、研究方向、职业特征、阅读习惯等,绘制不同类型的群组用户画像。
学术期刊根据用户画像体系,为不同用户群组和个体提供个性化、差异化的知识服务。学术期刊要加强新媒体平台知识内容的梳理和整合,为精准推送打好基础。不少学术期刊新媒体平台推出了虚拟专题、学术合集等,这对于精准推送十分有利。新兴的知识图谱技术使基于语义而非语篇进行知识融合成为可能。知识图谱技术将碎片化、孤岛状的知识点组织成语义一致的知识网络,提供更全面的信息,这为学术期刊实现精准知识服务提供了底层知识支撑。
(二)编辑收集有用信息
利用数据挖掘和分析,编辑可统计平台活跃用户、高分作者、热议话题、重点会议、关联主题等数据,这些数据将为编辑发掘潜在的核心作者、审稿专家、青年编委,策划新的选题,组织新的融媒体内容生产,开展和参加学术活动等,提供有价值的线索和依据。新的内容生产反过来又引起用户关注或讨论,形成新的使用数据,如此编读良性互动,有助于推动期刊高质量融合发展。
编辑利用平台收集有用信息,不仅涉及数据的统计和整理,还关乎内容的分析和评判。利用自然语言处理技术和文本数据挖掘技术,编辑可从文本中收集提取高质量信息。文本挖掘技术能够分析文本在情感上的倾向,在舆情监控、话题监督、口碑分析等方面发挥重要作用。
此外,编辑对平台信息的收集需要保持一定的持续性。一方面,研究趋势、话题的延展等有一定的发展过程;另一方面,“收集信息—应用—用户反馈—再收集”的良性互动需要持续推动,以提高数据的数量和质量,提升应用数据服务期刊建设的能力,提高用户满意度和使用黏性。
(三)助力平台社交功能发挥,凝聚学术共同体力量
新媒体平台具有强大的社交功能。从数据挖掘的角度来说,大数据的统计分析可为新媒体平台的社群建设提供强大助力。如社交媒体影响力作为新的论文评价的重要指标正日益受到重视。在当前的学术评价体系中,对学术期刊评价的关注大于学术论文本身;而对于学术论文的评价,各界对其初始评价(出版前)的重视又大于后期评价(出版后)。学术论文后期评价在评价体系的纵向链条上是极为关键的一环,具有成果鉴定和影响评估、完善评价体系、促进学术交流和知识共享、促进持续性研究、加强科研诚信监督、信息反馈等重要功能和价值。传统的学术论文后期评议(如论文评奖、科研考核、结题验收等)过于倚重“期刊指标”,存在不同程度的“以刊评文”现象。社会影响力评价是学术论文后期评价的一条新路径。具体到新媒体平台,平台所产生的点击量、下载量、浏览次数、评论次数等量化数据是后期评价的重要依据;而由平台社交圈所产生的点评、回复、讨论等内容信息更是当前移动阅读趋势下应给予关注的重要的定性评价来源。利用文本挖掘技术,通过对引用内容的语义分析,可揭示施引者的引证动机、态度、性质、深度等。数据挖掘技术使针对新媒体平台的社会影响力评价具有了操作的可能性,其将网络活跃的学术共同体纳入后期评价体系之中,使后期评价的客观性、科学性得到提升。
又如平台上的各种讨论交流,经过数据处理,不仅可为编辑选题策划提供信息来源,同时也是网络学术共同体研究与学习的有用参考资料。数据挖掘帮助学术共同体的思想和观点从散落到凝聚、从模糊到清晰,意志和作用从隐形到凸显,从数据效果端助力平台充分发挥其应有的社交功能,促进学术共同体在网络上形成新的集结,扩大期刊话语权和影响力。
(四)促进场景融合,拓展服务功能
新媒体平台建设既要考虑用户碎片化、移动化的时空场景使用特性,又要注意场景与场景之间的互动融合。新媒体平台除了可以营造“阅读”的场景,还要承担社交、支付、数据收集、虚拟购物、学术服务等多元化场景。大数据的统计与利用将为学术期刊新媒体平台适配移动使用场景、针对性进行用户激励、促进场景融合、拓展服务功能等提供技术支撑和数据支持,为学术期刊新媒体平台的高质量发展插上双翼。
在用户激励方面,用户在学术期刊新媒体平台所积累的阅读篇数、阅读时长、转发评论等数据可通过后台统计形成用户使用积分,达到一定积分,平台可对其进行物质或非物质的“奖励”,或给予类似终身教育领域的“微证书认证”,形成非正式学习成果作为继续教育学时证明,甚至纳入资历框架体系,实现学习成果的认证、积累与转换。数据挖掘技术为平台数据的统计、分析、成果生成提供了便利。学术期刊新媒体平台较多用于移动的工作和学习场景,其阅读行为具有长期持续、频率高、追求广度、互动性强等特点。“奖励”或“微证书认证”等措施能对用户在平台所进行的点滴学习和分享进行有针对性的鼓励和肯定,可提高用户黏性。
四、实施中的主要问题及对策
(一)技术支撑与思维转换
学术期刊开展数据挖掘工作需要一定的技术支撑,途径之一是引入外部力量,通过与专门从事数据挖掘的机构合作来开展此项工作。有条件的学术期刊也可依靠自身力量,进行相应的培训,或是二者互为补充、结合,同时加强复合型人才培养。需要指出的是,不论上述何种方式,技术只是表层的内容,真正推动工作的核心是思维的转换,即学术期刊要改革传统办刊模式为融媒体办刊模式,要将互联网思维、融合出版思维、平台思维贯穿到整体办刊工作当中,数据挖掘只是其中的一部分。只有工作中贯穿了改革思维,数据挖掘才能真正发挥应有的作用,真正赋能学术期刊新媒体的建设,推动期刊高质量发展。
(二)经验积累
一方面对象数据具有离散性,从离散的数据中挖掘有价值的数据,本身就需要海量的数据,需要一定时间周期或时间跨度的数据积累;另一方面有意识地采集数据需要把编辑需求转换成数据特征,这需要一定技术与传统编辑知识的反复交互,甚至推倒重来,同样需要时间沉淀。此外,网络用户对期刊的阅读存在随机性,从随机阅读里面提取用户行为特征,通过机器训练、培育的大数据分析模型并不能百分百对用户行为作出准确判断,需要提升模型本身的健壮性和准确性,提升分析和预测的质量。
(三)提高数据质量
数据质量、数据前期清洗和数据标准化的方法和模型选取会影响机器学习效率和智能分析模型的准确性,在对数据挖掘分析前需要对数据进行清洗。数据清洗是去除噪声和无关数据的过程,常见的数据清洗方法包括缺失值处理、重复数据处理、异常值检测和噪声过滤等。数据标准化是将不同来源、不同格式的数据转换为统一格式和尺度的过程。这对于机器学习算法和智能分析模型的训练和预测具有重要意义。常见的数据标准化方法包括归一化、标准化和离散化等。数据质量是机器学习与智能分析的基础,对于确保数据的准确性、完整性、一致性和时效性至关重要。在实际应用中,可以通过数据校验、异常检测和数据补全等技术手段来提高数据质量。
(四)用户隐私保护
数据的提取、分析及应用很多都涉及用户隐私。用户隐私不仅关乎个人尊严和信息安全,更是法律赋予公民的基本权利。从期刊新媒体数据挖掘利用方面来看,一是要加强用户管理,明确数据使用边界。如建立完善的用户管理制度,制定明确的用户信息收集、存储、使用及销毁等流程规范,确保用户信息在合法、合规的框架内被处理;在数据提取和分析前,明确数据使用的目的和范围,避免超出授权范围使用用户数据;建立健全的数据访问权限管理机制,确保只有授权人员才能访问敏感数据。二是要采用先进的技术手段保护用户隐私。如在数据提取和分析过程中,采用数据脱敏技术对敏感信息进行加密或匿名化处理,即使数据泄露也无法直接识别用户身份;又如访问控制和审计,实施严格的访问控制策略,确保只有授权人员才能访问敏感数据,同时,建立数据审计机制,记录数据访问和使用情况,及时发现和处理潜在的安全风险。
五、结语
本研究探讨学术期刊新媒体平台运用数据深度挖掘进行读者需求分析、信息反馈收集利用、学术论文后期评价、学术社群建设、学习积累认证、服务功能拓展等的实践,分析实施中需要注意的主要问题。本研究将学术期刊新媒体平台置于数字化出版模式下,有利于激活新媒体平台数据资源,延伸期刊工作链条,对接平台应用场景,提升知识服务水平,促进学术信息精准传播、学术共同体力量凝聚以及期刊影响力提升。■
(作者:张筱园,广东开放大学副编审,研究方向:学术编辑出版;邓君令,中国电信股份有限公司广东分公司高级工程师,研究方向:人工智能、大数据分析)















