「多模态语音理解大模型」共找到 1764 篇相关文章
ICLR-26腾讯混元:Agent是强大的,但用户是狂野的
现有LLM工具使用基准测试场景理想化,忽视真实用户行为复杂性。腾讯提出WildToolBench,基于真实用户行为构建测试集,对58个模型评估,发现模型准确率低,揭示LLM在真实场景下能力缺口,为模型优化指明方向。
Karpathy盛赞,啥都没有的创业公司刚融了1.8亿美元,要用小数据造强智能
AI创业公司Flapping Airplanes几乎无产品、盈利,也不急于商业化,却获1.8亿美元融资及Andrej Karpathy力挺。它专注解决“数据效率”问题,探索新思路,目标是做改变范式的研究。
Anthropic突然封禁第三方工具调用Claude,Cursor、OpenCode、xAI 集体“中枪”!项目做到一半突遭中断,官方解释是“误伤”?
Anthropic突然阻止第三方工具调用Claude,引发社区不满。开发者在项目进行中访问权限中断,官方称是‘误伤’,但实则是对第三方工具使用路径的调整,社区对此反应不一。
视觉优势还是语义依赖?揭秘 DeepSeek-OCR 高压缩率背后的真相
中科院等团队论文剖析 DeepSeek - OCR,通过实验揭示其高压缩率下准确率高或依赖语言先验。去掉语言先验,准确率暴跌;下游任务推理崩塌,长文本处理也有瓶颈。
欧洲版DeepSeek发布Mistral 3系列模型,多模态端云生态,无差别商用交付给全球开发者
欧洲最强AI公司Mistral AI发布全系开源模型Mistral 3,从675B到3B参数打通智能链路,采用先进架构,与业界合作优化,以Apache 2.0协议交付全球开发者,推动开源智能发展。
Thinking with Video:一种全新的思考范式
在人工智能领域,‘用文本思考’和‘用图像思考’存在局限。复旦大学等团队提出‘用视频思考’范式,通过视频生成模型统一文本与视觉推理,构建VideoThinkBench基准测试Sora - 2,全面解读这一开创性工作。
Feed-Forward 3D综述:三维视觉如何「一步到位」
这篇由12所机构联合撰写的综述论文,总结2021 - 2025年间数百项创新工作,建立Feed - Forward 3D方法谱系与时间线,介绍五大技术分支、应用场景、评测指标与结果,还指出未来挑战与方向。
手机操控革命!开源手机AI Agent,自然语言操控Android/iOS!
传统移动设备自动化工具难实现自然语言控制和跨应用交互,开源项目Mobile - Use提供解决方案。它由Minitap AI开发,能通过自然语言指令实现设备UI感知自动化,功能丰富,应用场景广。
美国航天局与谷歌合作,打造AI医疗助手,以保证宇航员健康
Techcrunch消息,美国宇航局NASA和谷歌合作开发AI医疗助手CMO - DA,保障前往火星的宇航员健康。它有多种模态功能,在谷歌云运行。经测试诊断准确性较高,未来还会增加数据源和情境感知能力。
2025 AI Agent 发展现状与六大趋势
近半年,Agentic AI 创新加快,推动产品落地与商业化。2025 年市场格局显现,有 Agentic RAG、Voice Agents 等六大关键趋势,各有定义和应用场景,不少公司已采用相关技术。