实时语音识别」共找到 764 篇相关文章

算法论文8

AI胡说八道这事,终于有人管了?

AI大模型幻觉问题棘手,GPT - 5幻觉率降低。苏黎世联邦理工学院和MATS研究提出低成本、可扩展检测法,精准识别实体级幻觉,分类器超现有基准,还能识别逻辑错误,团队已公开数据集。

机器之心
开源动态8

1B参数,0.21秒识别,0.3%错字率:混元OCR拿下7项SOTA

腾讯开源模型 HunyuanOCR 在权威榜单 OmniDocBench 上霸榜,虽仅 1B 参数,却在 7 项任务击败众多大模型。它解决传统 OCR 流水线及通用大模型痛点,通过独特架构和训练方法实现高效准确识别

CourseAI
产品应用7

DeepSeek识图模式全量上线,却认不出自家老板梁文锋

端午节前,DeepSeek全量推送识图模式。测试发现,它能认出黄仁勋,但忽略‘豆汁’字样,识别人物和潦草汉字准确率低,不过识别文物能力不错。还比较了与其他模型在乐理推理测试中的表现,开发者有新疑问待解答。

机器之心
产品应用8

首个真正“能用”的LLM游戏Agent诞生!可实时高频决策,思维链还全程可见

超参数科技推出全新游戏智能体COTA,它由大模型原生驱动,操作似职业选手,决策如教练,推理链路清晰。在自研FPS游戏Demo中表现出色,还打破‘不可能三角’,有望重构游戏人机关系。

量子位
算法论文8

数百个虚拟人在线逃生!天大等发布:首个实时在线多智能体模拟方法

天津大学联合清华和卡迪夫大学推出RESCUE系统,把「大脑感知 - 决策 - 行动」循环搬进电脑,让数百虚拟人在线逃生。该系统能实时呈现地形等信息,还能标记身体碰撞力,可用于公共安全场景演练。

新智元
算法论文8

SIGCOMM 2026 | 从「人眼看视频」到「AI理解视频」:北大提出面向AI的实时通信框架Artic

AI 正从「文字聊天」走向「边看边聊」,传统实时视频通信难以满足需求。北大团队提出 Artic 框架,重构码率自适应等,实验显示其能显著提升准确率、降低延迟。

机器之心
开源动态8

MiniCPM-o 4.5 技术报告发布:全双工全模态 API 开放,RTX5070 即可实时运行

面壁智能等发布 MiniCPM-o 4.5 技术报告,开放全双工全模态 API。该模型 9B 参数,RTX5070 可实时运行,下载量超 25 万。报告披露 Omni - Flow 框架,模型性能强,还能催生新应用。

AI前线
算法论文8

让AI读懂「言外之意」:AI4SG团队发布首个心理健康污名语料库,破解隐性偏见识别难题

心理健康患者常面临社会偏见,且这种污名化隐蔽难识别。新加坡国立大学AI4SG团队联合多学科专家,构建首个心理健康污名访谈语料库MHStigmaInterview,获ACL 2025认可,为解决该社会问题提供技术支持。

机器之心
开源动态8

具身智能从此「边听边说」,智源研究院开源原生全双工语音大模型RoboBrain-Audio

北京智源研究院联合多方发布原生全双工语音对话大模型 RoboBrain - Audio,采用新架构和创新训练范式,在性能上全面领先,革新音频 - 文本对齐方式,丰富了 RoboBrain 全栈体系,推动具身智能发展。

机器之心
开源动态8

李飞飞50亿美金赛道被开源!浙大教授章国锋带队创业,打造无限时长实时3D世界模型

2024年李飞飞创立的World Labs入局空间智能赛道,估值达50亿美元。近日影溯发布并开源实时帧生成模型InSpatio - WorldFM,由章国锋领衔,该模型突破2D局限,效率高、能无限时长推理,展现出高工程可用性。

机器之心