模型通用性」共找到 8240 篇相关文章

算法论文8

警告:你的Agent可能无法"解决"真实世界的视觉问题

文章提出 AgentVista 评测基准,含 209 道任务,横跨 7 大领域 25 个子方向。评测 14 个主流模型,最强的 Gemini - 3 - Pro 准确率仅 27.27%,揭示多模态 Agent 在视觉理解、工具调用等方面挑战大。

深度学习自然语言处理
新闻资讯7

Docker 通过 Cagent 提供 AI 代理确定测试

AI 代理系统普及,工程团队面临测试概率输出的挑战。Docker 的 Cagent 是一种 AI 代理确定测试方法,采用 proxy - and - cassette 模型,虽处早期,但揭示了 AI 代理测试的不同方向。

InfoQ
算法论文8

LeCun力荐的JEPA杀入LLM,用CV的思路训练LLM,能鲁棒双丰收

LeCun团队提出LLM - JEPA,将JEPA自监督学习架构从视觉扩展到LLM。它能提升能和鲁棒,在多模型和数据集验证有效,但有训练开销大、泛化不足等局限。

机器之心
推荐文章7

抄作业了!让AI产品告别“上线就崩”的CC/CD框架,6步搞定,拿走不谢。

文章指出AI产品因大模型不确定,易上线翻车。介绍海外流行的CC/CD开发框架,阐述AI产品不确定原因,强调自主与控制平衡,还给出该框架落地的6步工作流。

探索AGI
算法论文8

何恺明团队重磅新作:去掉VAE,无需Tokenizer,纯Transformer预测数据比预测噪声更高效

麻省理工学院何恺明团队发布颠覆研究,指出主流扩散生成模型未做好去噪工作,回归洁净数据预测才是高维像素生成正解。团队设计实验验证观点,提出极简架构JiT,展现优越能与扩展能力。

AIGC开放社区
推荐文章7

李飞飞World Labs最新判断:AI写完代码,下一步是「写世界」?

这篇来自 World Labs 的博客探讨了 AI 参与空间创作和现实世界任务时的通用接口,认为是 3D 。它像代码一样可结构化表达,还分析了神经图形学、模拟引擎的作用,并介绍了相关项目。

机器之心
新闻资讯7

Agent创业者的天塌了,OpenAI发布ChatGPT Agent

昨晚OpenAI发布ChatGPT Agent,这让Agent创业者紧张。它整合多种能力,功能强大,支持多操作。新模型经强化学习调优,在多基准测试中表现佳,或挤压初创公司通用Agent赛道空间。

花叔
开源动态8

DeepSeek多模态新范式:一张图压缩7056倍,思考能力反超GPT和Claude

DeepSeek上线多模态并开源新范式技术。该研究让AI用视觉原语思考,弥合语言与视觉指代鸿沟。它构建紧凑模型架构,信息压缩率达7056倍,训练分三阶段,测试中表现出色,也存在局限。

AIGC开放社区
算法论文8

DeepSeek-V4蓄势待发!梁文锋署名论文或开启第二个DeepSeek时刻

据报道,DeepSeek将于2月发布新一代旗舰模型DeepSeek V4,其编程能力或超Claude和GPT系列。最新论文提出Engram条件记忆机制,分离死记硬背与逻辑推理,揭示新稀疏分配定律。

AIGC开放社区
推荐文章7

AI 浏览器压根不可能成为新的操作系统

近期AI浏览器成大模型主战场,营销中模糊Browser和OS边界。文章指出‘AI Browser = OS’不成立,分析原因,还提出定义为Agent操作层更合适,未来或走向能力优先、标准互通的‘通用容器’模式。

Founder Park