全模态推理」共找到 3761 篇相关文章

新闻资讯8

图灵奖得主Bengio再创业:启动资金就筹集了3000万美元

图灵奖得主Yoshua Bengio官宣再创业,成立非营利组织LawZero构建下一代AI系统,不做Agent。已筹3000万美元启动资金,要做“设计即安”的AI,以监督Agent,将安性置于商业利益之上。

量子位
算法论文8

音频大模型安可信度的面“体检”!6大维度,清华南洋理工联手打造

南洋理工和清华团队提出新框架AudioTrust,将ALLMs评估扩至六个核心维度,探究音频模态特有问题。目前基准及平台已开发,揭示了开源与闭源ALLMs在多维度的潜在风险。

量子位
产品应用7

这样更公平:用jina-reranker-m0为多模态文档打分重排

文章指出多模态搜索领域给文档综合评分难,因文本与图像评分缺乏可比性。2025年4月发布的jina - reranker - m0可解决此问题,其两阶段检索流程能显著提升召回率,对多模态AI系统设计有启发。

Jina AI
产品应用7

Multi-Agent 的灵活编排之路

文章从Copilot 3.0架构规划模块出发,结合DeepSeek R1强化学习训练实践,探讨多智能体架构下大模型编排智能体解决问题。分析Copilot 2.0局限并介绍3.0升级,指出难点,展示效果对比及解决方案。

阿里云开发者
新闻资讯7

AI接管程序员!Anthropic创始人自曝行业末日时间表

Anthropic创始人Dario Amodei预测,AI三到六个月内或能编写90%代码,一年后可能编写所有代码。谷歌超25%代码已由AI生成。不过人类短期内仍在代码设计等方面重要,程序员要适应与AI协作。

新智元
开源动态8

超低延迟的端到端语音模型!首次生成音频仅需53ms,比同级别模型快3-5倍!

随着语音应用场景普及,语音大模型响应慢成瓶颈。VITA团队开源端到端语音模型VITA - Audio,7B参数模型首次生成音频仅53毫秒,比同级别快3 - 5倍,完开源,有超低延迟等优势。

开源星探
新闻资讯7

刚刚,OpenAI任命新CEO!

OpenAI宣布39岁的Fidji Simo出任「应用CEO」,向奥特曼汇报。奥特曼仍为CEO,未来专注研究、算力与安。Fidji经验丰富,曾在Facebook工作十年,还担任过Instacart CEO。

新智元
产品应用7

我是如何破解 NotebookLM 系统提示词的?

作者分享通过“逆向推理”破解NotebookLM系统提示词的故事,介绍系统提示词概念、破解原因、策略及从播客音频逆推提示词的方法,还提到该方法的效果及局限性 。

宝玉AI
产品应用9

深度拆解 Gemini 3.8 Live:一句插话,为什么会牵动整个 Agent 系统

本文深度拆解Google发布的Gemini 3.8 Live,分析其将语音、推理、工具调用整合进持续运行链路的架构创新,探讨Voice Agent进入Runtime阶段的核心技术挑战与未来AI Agent发展趋势。

AI科技评论
新闻资讯8

宇树智元共用一个大脑!神秘模型Demo炸场,10分钟一镜到底

一条10分钟一镜到底的Demo视频引发关注,视频中宇树和智元的机器人同用一个“大脑”,完成多种任务,如擦窗、收纳等,还展现出跨本体协作等能力。该模型跳出主流具身模型固有框架,或改写具身智能行业认知。

量子位