查看: 1260|回复: 3

Modulate Velma语音深伪实时检测与干预平台

[复制链接]
发表于 昨天 08:00 | 显示全部楼层 |阅读模式
融资与公司定位
据 SecurityWeek 报道,AI 语音技术公司 Modulate 完成额外 2500 万美元融资,投资方为 Future Ventures,Hyperplane 和 Lakestar 参投。本轮融资后,Modulate 累计融资达到 6000 万美元。

Velma 平台与技术
Modulate 专注音频原生 AI 模型,目标是让机器理解人类对话中的细微特征,并区分真实与合成语音。其 Velma 平台基于自研 Ensemble Listening Model(ELM)架构,集成 100 多个专用模型,用于识别情绪、语气、意图、合成语音和对话行为等信号。

公司披露,目前每月分析超过 1000 万小时音频,累计分析超过 6 亿小时。Modulate 称其转写和深伪检测模型在 Hugging Face 等公开基准上排名第一;Velma 结果比传统 LLM 准确率高两倍,误报少七倍。由于 Velma 支持实时运行,基于它的应用不只是理解正在发生什么,还能在对话过程中进行干预。

应用场景
原文列出的典型应用包括:保护医疗机构免受深伪攻击;增强语音 AI 代理的情感和共情能力;减少社交平台上的极端主义和骚扰;观察和监控语音代理表现;检测并阻止儿童诱骗类语音对话;在高风险场景中通过高级语音掩蔽保护代理身份。

Modulate CEO 兼联合创始人 Carter Huffman 表示,语音正在成为 AI 的主要接口,这带来了仅靠转录文本无法解决的新问题。公司正在使用音频原生 AI 保护组织免受深伪攻击,帮助语音代理理解情绪并更有共情地回应,识别在线对话中的危险行为,并监控语音代理是否按预期运行。

资金用途与行业背景
新资金将用于扩充 Modulate 团队和基础设施,扩展可供开发者和合作伙伴使用的模型、API、SDK、集成和部署选项,同时继续投资底层研究和技术。原文指出,AI 辅助欺诈深伪的对抗性使用以及语言滥用已成为现实;如果不使用 AI,几乎不可能及时检测深伪并识别滥用。构建能检测语音滥用的应用并不容易,Modulate 的定位是提供音频智能层,使开发者不必每次创建新的语音体验时都重建该层。Huffman 补充称,其使命是构建模型和基础设施,让开发者专注应用开发;音频原生 AI 的机会正在快速扩大,公司已构建技术并在规模上验证,本轮投资将用于扩大团队并更快满足需求。
回复

使用道具 举报

发表于 昨天 19:30 | 显示全部楼层

Re: Modulate Velma语音深伪实时检测与干预平台

感谢楼主整理,信息量挺足。Modulate 这轮拿到额外 2500 万美元,累计融资到 6000 万美元,说明音频原生 AI 和实时深伪检测这个方向确实受到资本关注。Velma 基于自研 ELM,集成 100 多个专用模型,用来识别情绪、语气、意图、合成语音和对话行为,而且每月分析超过 1000 万小时音频、累计超过 6 亿小时,这个规模听起来很可观。 我觉得最关键的是它支持实时运行,不只是事后检测,而是在对话过程中干预。如果真能达到披露的比传统 LLM 准确率高两倍、误报少七倍,那对医疗防深伪、社交平台减少极端主义和骚扰、儿童诱骗检测这些场景会很有价值。语音代理的情感和共情能力、高风险场景的身份掩蔽,也说明音频智能层不只用于安全,还能提升交互体验。 资金用途上,扩团队和基础设施、扩展模型 API SDK 集成部署,同时继续投底层研究,路线比较务实,像是想做开发者不用重复造轮子的音频智能层。CEO 提到语音正在成为 AI 主要接口,仅靠转录文本解决不了新问题,这个点挺有现实针对性。后续比较期待看到真实部署效果,尤其误报控制的实际表现。
回复 支持 反对

使用道具 举报

发表于 昨天 19:30 | 显示全部楼层

Re: Modulate Velma语音深伪实时检测与干预平台

感谢分享,这个信息挺有分量。Modulate 这轮融资和累计融资额能看出,音频原生 AI 在深伪检测和语音交互安全上确实被看重。Velma 用 ELM 架构集成 100 多个专用模型,还能每月分析超过 1000 万小时音频,说明不只是概念,已经有规模验证的意味。尤其是实时运行并干预这一点,比单纯事后审核更有价值,因为语音对话里的风险往往发生得很快。 应用场景里,医疗防深伪、儿童诱骗检测、社交平台治理和高风险语音掩蔽都挺关键。如果真能做到比传统 LLM 准确率高两倍、误报少七倍,那落地时最怕的误杀和延迟问题会缓解不少。资金用途提到扩展 API、SDK、集成和部署选项,我也比较好奇后续会不会让中小开发者更容易接入,以及这些场景里哪个会最先规模化落地。语音成为 AI 主要接口这个判断,从首帖看确实能解释为什么需要专门的音频智能层。
回复 支持 反对

使用道具 举报

发表于 昨天 19:35 | 显示全部楼层

Re: Modulate Velma语音深伪实时检测与干预平台

感谢分享,这个方向确实值得关注。语音正在成为 AI 的主要入口,很多风险光靠转写文本确实看不出来,Velma 这种音频原生、还能实时干预的思路,比事后审核更有价值。100 多个专用模型集成到 ELM,月分析超过 1000 万小时,也说明它不只是概念阶段。 应用场景里,医疗防深伪、儿童诱骗检测、社交平台极端主义和骚扰治理都挺关键,同时也对语音代理的情感和共情能力有帮助。融资用于团队、基础设施、API、SDK 和部署选项,看起来比较务实。 我会比较关心几个落地问题:实时检测的延迟和算力成本、高风险场景下的误报和漏报责任、以及语音数据的隐私和合规边界。如果这些能讲清楚,开发者和机构采用起来会更放心。整体看,音频原生 AI 作为一层基础设施,潜力不小,后续真实场景效果值得继续观察。
回复 支持 反对

使用道具 举报

您需要登录后才可以回帖 登录 | 注册

本版积分规则

指导单位

江苏省公安厅

江苏省通信管理局

浙江省台州刑侦支队

DEFCON GROUP 86025

Hacking Group 021A

旗下站点

态势感知中心

应急响应中心

红盟安全

联系我们

官方QQ群:112851260

官方邮箱:security#ihonker.org(#改成@)

官方核心成员

关注微信公众号

Archiver|手机版|小黑屋| ( 沪ICP备2021026908号 )

GMT+8, 2026-9-30 06:17 , Processed in 0.026801 second(s), 17 queries , Gzip On, Redis On.

Powered by ihonker.com

Copyright © 2015-现在.

  • 返回顶部