-
用 WebRTC 与 Cloudflare Durable Objects 构建一个零知识 P2P 同步引擎
利用 WebRTC 和 Cloudflare Durable Objects 构建零知识 P2P 同步引擎:如何实现桌面端和移动端之间即时、无需账户、端到端加密的笔记同步,且无需任何云存储成本。
-
RTC 如何成为流媒体时代的实时基础设施
设想这样一个场景:直播间里主播喊出”3、2、1,上链接“,你看准时机点下去,页面却纹丝不动——半秒之后才告诉你”已抢完“。或者一场线上拍卖,锤子落下的画面比成交价刷新慢了整整一秒,…
-
从“看见文字”到“读懂画面”:AI MediaKit 如何实现视频字幕无痕擦除
面向字幕擦除等真实业务场景中的复杂难题,火山引擎推出 AI MediaKit 理解式视频编辑引擎,并以自研 ReFM(Residual Flow Matching,残差式流匹配)作为视频生成修复主干。
-
实时语音 AI 如何赋予开发者更多交付控制权
AI 可以在几秒钟内生成对话,而语音技术则负责将这些文字转化为逼真的对话。当没有人能够预先预测确切的句子时,台词的发音方式就显得尤为重要。Inworld 最新的文本转语音技术正是围…
-
腾讯混元发布 Hy Image3.5 preview 专业生图模型
今天,腾讯混元正式发布混元图像 3.5 预览版(Hy Image3.5 preview)。 这是一款高性价比的专业级生图模型,经过数百名内部专业设计师GSB盲测,模型能力对比 Hy…
-
SoundHound AI 重新构想联络中心的人机交接
SoundHound 为其对话式 AI 平台 SoundHound AI OASYS 新增了一项人工协助解决(Human Assisted Resolution,HAR)能力。 这…
-
研究:默认流媒体服务更不容易被取消
在订阅制业务中,并非所有订阅用户都具有同等价值。用户参与度越高,留存率就越高,流失率就越低。根据 Hub Entertainment Research 发布的《解码默认设置 202…
-
Konstrukt 推出开源媒体播放器 Omakase Player
媒体技术工程公司 Konstrukt 推出了开源媒体播放器 Omakase Player 。 该公司表示,这款浏览器原生、时间线优先的 JavaScript 框架专为帧精确播放、丰…
-
联络中心 AI 治理实战指南
管理联络中心 AI 的企业 CX 负责人,需要一套治理框架来监管客户数据的访问权限,并对 AI 能力设定限制与管控。 你的联络中心很可能已经在某种程度上使用了 AI 功能与工具。你…
-
Valve推出Pyrowave视频编解码器测试版,用于低延迟流媒体传输
Valve 的 Steam 客户端测试版今天推出了 Pyrowave,这是一款用于高带宽、低延迟视频流的实验性视频编解码器。 此前,Valve 在今年夏天就传出正在为 Steam …
-
Vulkan 1.4.363 发布,新增 VK_INTEL_device_info 扩展
Vulkan 1.4.363 是 Vulkan API 规范的最新例行更新,并引入了一个新的 Intel 厂商扩展。 Vulkan 1.4.363 对规范的不同部分进行了多项澄清,…
-
数美科技携手形界智能,共建AI实时视频生成新生态
9月20号,形界智能正式发布Genesis1.0,进一步探索视频生成从“生成即完成”迈向“实时交互、持续感知回应”的形态。 人与AI的交互方式正在被重新塑造。在形界智维CEO王裕鑫…
-
用 Go 构建一个实时聊天服务器:一个 WebSocket 最小可行方案
如果你用 Go 写过 REST API,却从没碰过 WebSocket,那么构建一个聊天服务器是动手学习 Go 并发模型的最佳方式之一。不用框架,不用黑魔法,只有 goroutin…
-
Live Captioning Engineering:业界首个直播电商 AI 实时字幕系统的端到端实践
在快手电商直播间,大量用户会在通勤、办公或静音环境下观看直播,声音一旦缺失,主播口中的价格、规格、优惠也随之消失。我们花了半年多时间,把”主播说话到字幕上屏”…
-
ZEGO即时通讯SDK发布3.2.0版本,新增社群会话管理和社群加入前审核等功能
2026 年 9 月 18 日,ZEGO 即时通讯SDK(ZIM) 3.2.0 版本发布,新增社群会话管理、社群加入前审核和支持为所有成员删除消息等功能。 新增功能 会话列表新增社…
-
Zipper-LoRA:面向 Speech-LLM 多语种语音识别的动态参数解耦方法
本工作为 Speech-LLM 多语种参数高效微调提供了一种新的技术思路,可进一步推广至多语种语音识别、语音理解及其他基于大模型的参数高效微调任务,为大规模多语种语音模型的训练与部署提供了新的解决方案。
-
Signal 大会:Twilio 打通 AI、数据与客户沟通渠道
Twilio 高管在周四的 Twilio Signal 新加坡大会主题演讲中表示,企业需要将 AI 与通信渠道和客户数据连接起来,才能让客户互动更加连续、更有场景感。 Twilio…
-
为什么没有联网语音 AI ,客户服务就会失败
如果客服人员能够真正听到客户的需求呢? 如今,语音 AI 已经能够做到这一点。它不仅能够理解客户的意图,还能检测出客户的沮丧情绪,捕捉到情感语境,并记住客户的历史记录,包括他们…
-
阶跃发布旗舰模型 Step 5 Preview:向前一步,智能效率的新一代“帕累托前沿”
今天,阶跃新一代旗舰模型 Step 5 Preview 发布。 这是一款面向真实世界 Agentic 任务的旗舰基座模型。随着 Agent 从“回答问题”走向“完成任务”,日常工作…
-
SpaceXAI 发布 Grok Voice Transcribe 2.0:一款语音转文本 API,每小时收费 0.10 美元
SpaceXAI 发布了 Grok Voice Transcribe 2.0,这是其最新的语音转文字(STT)模型。开发团队称其在价格不变的前提下,准确率是 Grok Voice …