-
数美科技携手形界智能,共建AI实时视频生成新生态
9月20号,形界智能正式发布Genesis1.0,进一步探索视频生成从“生成即完成”迈向“实时交互、持续感知回应”的形态。 人与AI的交互方式正在被重新塑造。在形界智维CEO王裕鑫…
-
用 Go 构建一个实时聊天服务器:一个 WebSocket 最小可行方案
如果你用 Go 写过 REST API,却从没碰过 WebSocket,那么构建一个聊天服务器是动手学习 Go 并发模型的最佳方式之一。不用框架,不用黑魔法,只有 goroutin…
-
Live Captioning Engineering:业界首个直播电商 AI 实时字幕系统的端到端实践
在快手电商直播间,大量用户会在通勤、办公或静音环境下观看直播,声音一旦缺失,主播口中的价格、规格、优惠也随之消失。我们花了半年多时间,把”主播说话到字幕上屏”…
-
ZEGO即时通讯SDK发布3.2.0版本,新增社群会话管理和社群加入前审核等功能
2026 年 9 月 18 日,ZEGO 即时通讯SDK(ZIM) 3.2.0 版本发布,新增社群会话管理、社群加入前审核和支持为所有成员删除消息等功能。 新增功能 会话列表新增社…
-
Zipper-LoRA:面向 Speech-LLM 多语种语音识别的动态参数解耦方法
本工作为 Speech-LLM 多语种参数高效微调提供了一种新的技术思路,可进一步推广至多语种语音识别、语音理解及其他基于大模型的参数高效微调任务,为大规模多语种语音模型的训练与部署提供了新的解决方案。
-
Signal 大会:Twilio 打通 AI、数据与客户沟通渠道
Twilio 高管在周四的 Twilio Signal 新加坡大会主题演讲中表示,企业需要将 AI 与通信渠道和客户数据连接起来,才能让客户互动更加连续、更有场景感。 Twilio…
-
为什么没有联网语音 AI ,客户服务就会失败
如果客服人员能够真正听到客户的需求呢? 如今,语音 AI 已经能够做到这一点。它不仅能够理解客户的意图,还能检测出客户的沮丧情绪,捕捉到情感语境,并记住客户的历史记录,包括他们…
-
阶跃发布旗舰模型 Step 5 Preview:向前一步,智能效率的新一代“帕累托前沿”
今天,阶跃新一代旗舰模型 Step 5 Preview 发布。 这是一款面向真实世界 Agentic 任务的旗舰基座模型。随着 Agent 从“回答问题”走向“完成任务”,日常工作…
-
SpaceXAI 发布 Grok Voice Transcribe 2.0:一款语音转文本 API,每小时收费 0.10 美元
SpaceXAI 发布了 Grok Voice Transcribe 2.0,这是其最新的语音转文字(STT)模型。开发团队称其在价格不变的前提下,准确率是 Grok Voice …
-
Steam Frame 利用 Zink 在 Vulkan 上实现 OpenGL
Valve 的 Steam Frame VR 头显采用高通骁龙 8 Gen 3 SoC 和 Adreno 图形处理器,正如去年报道的那样, 它使用了 Mesa 的开源 Vulkan…
-
ZEGO 云端语音实时识别新增支持 Qwen-Audio-3.0-ASR-Flash-Streaming 模型
2026 年 9 月 17 日,ZEGO 云端实时语音识别产品发布 v2.4.0 版本,新增支持 Qwen-Audio-3.0-ASR-Flash-Streaming 语音识别模型…
-
2026 年 GitHub 上顶级的 WebRTC 开源媒体服务器
2026 年的 WebRTC 开源媒体服务器都有哪些,基于 GitHub 星标来看哪些最好。不同的工具适合不同的场景。也就是说,这里排位靠后的一款 WebRTC 媒体服务器,可能恰恰最适合你的需求。
-
PipeWire 1.6.9 发布,改进了蓝牙、JACK、ALSA 插件、Pulse 服务器等功能
PipeWire 1.6.9 于今日发布,这是 PipeWire 1.6 系列最新版的第九次维护更新,该开源软件用于在基于 Linux 的操作系统下处理音频和视频流。 PipeWi…
-
构建联络中心安全可靠的 AI 规模化扩展路线图
扩展联络中心 AI 不仅仅意味着确保首次部署的安全,企业还必须控制访问权限、测试安全防护措施、监控行为,并随着 AI 扩展到系统、数据和工作流程中而调整权限,从而确保从部署到扩展的整个过程中安全性始终保持一致。
-
EgoInteract:一种面向第一人称视觉理解、具备自纠正能力的交互式多模态智能体
第一人称视觉交互要求 Agent 在动态社会环境中通过多模态对话和工具使用解决真实世界任务。EgoInteract 将采样帧视为视觉假设,维护证据账本,并通过官方工具将可见实体规范…
-
vLLM 新增支持 NVIDIA GPU 硬件视频解码,多 GPU 视频描述吞吐最高提升一倍以上
2026 年 9 月 18 日,vLLM 官方博客宣布,vLLM 已正式支持 NVIDIA GPU 内置的硬件视频解码能力。借助这一集成,此前受限于 CPU 的视频描述(video…
-
当 CX 软件开始自我配置
评估面向客户的 AI 智能体时,企业往往把注意力放在它们能做什么上。AI 理解请求并检索到正确信息的可靠性有多高?它能否在不把客户转接给人工的情况下完成一笔交易? 但 AI 部署失…
-
研究:73% 的广告商计划投资体育赛事直播
体育赛事直播仍然是广告商触达大量热情粉丝的最有价值渠道之一。随着体育赛事观看方式的转变,广告商也越来越多地追随粉丝的脚步,转向流媒体电视。 Premion 和 Advertiser…
-
Fonn Group 全面收购 everviz,并推出全新图形平台
Fonn Group 在今年早些时候收购 everviz 之后,推出了一个新的广播图形平台。 这个名为 Teikna 的新平台面向广播、流媒体和数字媒体。 据该公司称,Teikna…
-
OpenCL 3.1.2 发布,cl_khr_command_buffer 已升级
Khronos Group 今日发布了最新版本的 OpenCL 规范,其中包含多项变更。 随着 OpenCL 3.1.2 规范的发布,cl_khr_command_buffer 扩…