|
|
|
|
|
AI模型揭示人类阅读机制,为个性化文本与增强现实技术优化铺平道路 |
|
研究人员如今不仅探明了阅读时的眼球运动规律,更厘清了人类从文本中构建意义的过程 |
芬兰阿尔托大学的研究人员联合国际合作伙伴,研发出了迄今为止精准度最高的人类阅读机制模型。这款新模型借助强化学习(一种应用于机器人领域的人工智能技术),解释并复现了读者在阅读文本过程中做出的各类视线选择。
“我们首次运用人工智能方法去理解人类的阅读行为,而非仅仅进行模仿。”芬兰阿尔托大学的Antti Oulasvirta教授表示。这项研究于8月10日周一发表在《自然·人类行为》期刊上。研究人员称,该模型可驱动更智能的增强现实(AR)显示设备,还能根据不同读者的需求与日常场景,对复杂文本进行个性化适配。
Oulasvirta解释道,早期模型通过学习大量配对文本片段与眼动追踪数据的训练集,进而模仿人类行为,但这类模型无法真正理解文本内容,在不同语言或语境下的泛用性也较差。与之不同,新模型遵循读者调控注意力的心理机制,揭示了视线在单词、句子和段落间移动的过程中,人类是如何逐步构建对文本的理解的。
Oulasvirta认为,探明人类记忆如何服务于阅读过程,是解锁各类可定制应用、服务与产品巨大潜力的关键。“我们无时无刻不在阅读,但纵观文字发展的历史,我们读到的文本都是面向大众生产的,而非针对特定个人与特定场景定制。”他表示,“如今我们有能力改变这一现状。”
新模型以“资源理性”理论为核心指导:该理论提出,阅读过程中人类会不断决定下一个视线落点,以求在可用时间内最大限度地提升对文本的理解。视线分配的决策分为单词、句子、全文三个层级,会受到读者的语言能力、记忆容量、视力水平与眼动速度等多种因素影响。举例来说,记忆力好的快速阅读者可以顺畅地从一个段落跳转到下一个段落,而记忆力较弱的读者则更有可能回视前文内容。
“阅读看似毫不费力,但大脑其实一直在持续决策:看向哪里、跳过哪些内容、何时回视——就像支配预算一样分配注意力,以此实现理解效果的最大化。”香港城市大学的Shengdong Zhao教授表示。
研究人员将读者的各项特征设为可调节参数,随后让模型自主学习调控注意力的最优策略。“我们将模型置于包含数百万份文本的环境中,再借助基于人工智能的强化学习技术训练它优化眼动模式,最终让它能够真正理解所读的内容。”Oulasvirta解释道。
在阅读过程中,模型会生成一份文本内容的精简摘要。当发现关键单词或从句信息缺失时,它会调整视线去补全相关信息。通过询问模型在给定时间和约束条件下从文本中保留了哪些内容,可以检验其理解能力。
研究人员将模型的注意力分配决策与真实的人类眼动追踪数据进行对比后发现,模型的决策与读者的实际行为高度吻合。实际上,研究团队成功构建了一个“普通读者”基准模型,且该模型可根据不同的读者画像进行个性化适配。
这项研究成果为新型阅读辅助工具与个性化文本设计的发展铺平了道路。例如,该模型可赋能智能眼镜,让设备根据场景与用户需求调整屏幕文本的呈现节奏与排版布局,也可直接为用户定制适配的文本内容。
“我们可以拿同一份原始文本——比如一段晦涩的法律文书——稍作处理就能生成不同版本,让不同水平的读者都能更好地理解内容。”Oulasvirta表示。
该研究团队的下一步计划,是评估该模型如何为阅读障碍人群与语言能力较弱的群体提供帮助。“我们希望在实时场景中为用户提供帮助,比如设计出既能辅助驾驶员阅读、又不会分散其注意力的文本。”Oulasvirta称,“如今我们对阅读这项与生活息息相关的行为有了全新的认知,接下来就是去探索它的所有应用可能。”
除阿尔托大学外,参与这项研究的还有来自香港科技大学、香港城市大学与新加坡国立大学的研究人员。
相关论文信息:https://doi.org/10.1038/s41562-026-02534-0
版权声明:凡本网注明“来源:中国科学报、科学网、科学新闻杂志”的所有作品,网站转载,请在正文上方注明来源和作者,且不得对内容作实质性改动;微信公众号、头条号等新媒体平台,转载请联系授权。邮箱:shouquan@stimes.cn。