-
腾讯混元发布 Hy ASR 3.0 preview:真正懂上下文的语音识别
今天,腾讯混元正式发布新一代语音识别模型 Hy ASR 3.0 preview。 基于最新一代大语言模型 Hy3 的语言理解能力,Hy ASR 3.0 preview 融合高精度语…
-
BBC、ITV 与 Shure 如何塑造沉浸式现场音乐直播的未来
随着音乐节不断拓展其数字化影响力,一项全新的跨行业创新项目正在探索能否将沉浸式技术推向更高层次。该项目名为 IFeL:沉浸式音乐节直播——大规模远程在场(Immersive Fes…
-
ZEGO 实时互动 AI Agent 2.13.5 发布:实时播报数字人正式上线,支持 CDN 拉流
ZEGO 实时互动 AI Agent 迎来 2.13.5 版本更新。本次版本核心亮点是新增实时播报数字人能力,一种区别于互动数字人的全新 Agent 类型,专注于单向内容输出场景,…
-
论文解读|ECoM-Reasoning:让端到端的语音大模型学会轻量级推理
以 GPT-4o、Moshi、GLM-4-Voice、Qwen-Omni 为代表的端到端语音大模型(SLM)正在推动人机交互迈向“开口即对话”的新阶段。然而,在需要精确、结构化推理…
-
Cisco Webex 与 8×8:统一通信和客户体验背后的企业平台之争
Cisco 的目标客户是希望在单一指挥层下管理统一通信、联络中心、设备和 AI 的企业级买家。而8×8的目标客户则是厌倦了集成工作、希望统一通信即服务(UCaaS)、联络中心即服务…
-
对讲方案选型、硬件链路、音频引擎、RTP/WebRTC,到弱网、AEC 与量产测试的完整技术拆解
本文从产品选型开始,逐层拆解端侧硬件、软件架构、网络协议和音频算法,并给出一套适合嵌入式 Linux 平台的推荐落地音频对讲方案。
-
Avaya任命Jeff Clarke为首席执行官,Patrick Dennis为执行董事长
2026年8月3日,Avaya 任命拥有 30 年企业技术经验的 Jeff Clarke 为首席执行官,Patrick Dennis 继续担任 Avaya 执行董事长。Clarke…
-
GPT-Live 如何在六个月内构建响应式语音 AI 实时系统
OpenAI 推出 GPT-Live,实现与 AI 的连续语音交互。该系统采用无轮次语音模型和低延迟架构,使对话更快、更自然。GPT-Live 的构建耗时六个月,核心在于减少交互延…
-
超越转录:对话式语音识别 (CSR) 如何教会 AI 真正倾听
随着语音 AI 越来越深入地融入日常产品,一种新型技术正在悄然取代传统的语音系统。这种被称为对话式语音识别(CSR)的技术正在重新定义机器理解人类语言的意义。 多年来,语音识别技术…
-
Disney+ 在专利裁决后恢复 4K 超高清播放
由于一项与视频技术专利相关的法院裁决,迪士尼已在多个欧洲市场暂时从 Disney+ 中移除 4K 超高清和 HDR 流媒体服务,导致受影响的高级订阅用户无法享受订阅中包含的最高质量…
-
FFmpeg 9.0 发布,增强了 Vulkan 加速、动画 WebP 和更多 AMD AMF 支持
FFmpeg 9.0 现已发布,这是这款广泛使用的开源多媒体库的最新版本。 FFmpeg 9.0 包含诸多重大改进,包括更多 Vulkan API 加速功能,例如Vulkan AP…
-
下一代视频编码国际标准(H.267)技术提案征集正式启动:ITU-T SG21国内对口组诚邀国内产业界和专家参与
2026年7月28日,国际电信联盟(ITU)、国际标准化组织(ISO)和国际电工委员会(IEC)联合发布下一代视频压缩技术提案征集(Call for Proposals),面向全球…
-
Day-0支持|摩尔线程率先完成MiniMax H3多模态生成模型适配
今日,MiniMax正式开源多模态生成模型MiniMax H3。同日,摩尔线程基于AI训推一体智算卡MTT S5000及MUSA软件栈,率先完成H3的极速适配与高效运行。这一成果不…
-
AI 虚拟形象市场规模将从2026年的10.812亿美元增长到2033年的79亿美元
市场研究机构 Grand View Research 报告中称 2025 年全球 AI 虚拟形象市场规模为8.084亿美元,预计将从2026年的10.812亿美元增长到2033年的…
-
将智能推向数据源:为何实时处理是边缘 AI 的核心
AI 正迅速融入日常设备,如智能手机、汽车、摄像头,甚至家用电器。传统上,这些系统依赖云服务器来发送、处理和分析数据,然后才能做出决策,这增加了延迟并拖慢了响应速度。然而,许多应用…
-
WebRTC Android 端 + iOS-Android 跨平台音频通话实战
iOS WebRTC 跑通了,但 Android 端的依赖、权限、Camera2 采集、前后摄切换,和 iOS 完全是两个世界。本文用 Claude Code 写 Android …
-
AI 音频公司 Vocalbeats.AI 以战略合作伙伴身份加入 AGI Playground
2026年8月3日,总部位于新加坡的 AI 音频公司 Vocalbeats.AI 今日宣布,将成为 AGI Playground 2026的战略合作伙伴。AGI Playgroun…
-
MeanVC 2:面向低延迟与鲁棒性的流式零样本语音转换
零样本语音转换旨在保留语音语言内容的同时,将源说话人音色迁移至任意未见过的目标说话人。随着实时通信、直播互动、在线会议、游戏语音等应用场景的发展,语音转换系统对低延迟、轻量化和高保…
-
通义千问发布 Qwen3.8-Max,2.4T 参数开源在即
摘要:通义千问发布最强模型 Qwen3.8-Max,参数规模达 2.4T,主打自主编程与多模态能力,可完成 10 天以上自进化开发及 500+ 轮芯片设计优化。模型将于下周开源权重…
-
FreeWheel发布视频内容报告
面向电视广告生态系统的技术平台 FreeWheel 推出了视频内容报告,这是一款仅在 FreeWheel Buyer Cloud(前身为 Beeswax)中提供的洞察工具,旨在帮助…