人力资源科技的未来会抛弃键盘吗?一组科技专家预测,在两到三年内,人们将越来越多地通过具备认知能力的语音和视频界面与 AI 互动,而不是主要通过文本输入。
这是专业技术组织 IEEE Future Directions 近期发布的《2030年技术大趋势》报告中的一项发现。该报告基于来自 38 个国家 168 位技术专家的意见撰写而成,并将人机交互评为所评估的 30 项技术中发展最快的技术。

语音通话功能正在增强吗?
人力资源执行团队注意到语音工具的使用率有所上升,这一功能在人力资源顶级产品使用的过程中频繁出现。在某些情况下,语音功能是作为附加功能提供的,尤其是在员工自助服务功能中。而在其他情况下,语音和视频功能则是产品本身的完整功能。
还有更多证据表明,越来越多的组织将减少员工和客户之间的文字互动。Gartner预测,到2028年,30%的财富500强企业将“仅通过单一的、AI 驱动的渠道提供(客户)服务,该渠道允许通过文本、图像和声音进行沟通”。
据麦肯锡的研究人员说,这种增长得益于多模态 AI 模型的日益普及。“它们模拟了大脑整合感官输入的能力,从而对世界形成细致入微、整体性的理解,就像人类运用各种感官感知现实一样,”一份简报中写道。这些 AI 模型能够感知多种输入(它们也能产生输出),这使得它们能够以“创新和变革性”的方式与世界互动。
多模态 AI 比以往任何时候都更容易获取
至少在创新方面,这列高速行驶的列车正在疾驰。据 Gartner 预测,到 2030 年,80% 的企业软件和应用程序将实现多模态交互,与 2024 年不足 10% 的比例相比,增长迅猛。然而,尽管 AI 正以惊人的速度向多模态方向发展,但根据 IEEE 的时间表,没有证据表明文本交互正在消失。
Gartner指出,“如今,许多多模态模型能够处理两到三种模态的数据”,例如文本转视频或语音转图像。Gartner预测,这些模型的功能将迅速提升,涵盖更多新的模态范围。
麦肯锡表示,性能的提升伴随着生成准确结果所需时间的缩短。此外,该领域的成本也大幅降低。“构建这些模型的成本正在急剧下降。例如,索尼人工智能的研究人员最近证明,2022年训练一个模型需要花费10万美元,而现在训练一个这样的模型只需要不到2000美元。”麦肯锡指出。
Gartner 高级总监分析师 Roberta Cozza 表示:“企业应专注于将多模态功能集成到其软件中,以提升用户体验和运营效率。通过利用多模态 GenAI 提供的多样化数据输入和输出,企业可以释放更高水平的生产力和创新能力。”
本文来自作者投稿,版权归原作者所有。如需转载,请注明出处:https://www.nxrte.com/zixun/71495.html