「长期任务」共找到 2186 篇相关文章
UniPat AI开源SWE-Vision:五百行代码打造SOTA视觉智能体!
多模态大模型代码能力进步大,但基础视觉任务常失误。UniPat AI开源SWE-Vision框架,让模型用Python代码处理视觉判断。它极简设计,在五个视觉基准测试达最优,提升前沿模型视觉表现。
突然爆火!近千人大排长龙安装!有人宣称短短数日已赚26万元!昆明市场有人报价300元;官方发声:警惕安全风险
OpenClaw是一款开源AI智能体,能接管电脑完成多种任务,但安装复杂。这催生“代装AI”生意,有人数日赚26万,腾讯免费安装引千人排队。不过,其部分实例存安全风险,官方提醒防范。
GAN之父Ian Goodfellow病后归来,剑指高效世界模型
GAN之父Ian Goodfellow等提出,利用符号化表示和游戏虚拟世界数据,或为构建动作条件多模态世界模型最佳路径,该模型可支持长时序任务预测与规划,还探讨构建原因、数据来源等。
开源模型终于有了自己的 Opus 时刻
智谱深夜发布的新一代旗舰模型 GLM - 5,此前以匿名模型 Pony Alpha 被开发者热测。2026 年编程大模型风向转变,GLM - 5 参数提升,测试成绩优异,实测能完成复杂工程任务,适配国产算力平台。
陈天桥邓亚峰联手破解大模型记忆难题!4个月打造SOTA系统,悬赏8万美元发起全球记忆挑战赛
今年全球AI圈聚焦大模型记忆技术。陈天桥和邓亚峰带队的EverMind推出世界级长期记忆系统EverMemOS,发布即SOTA。其模拟人脑记忆机制,开源且上线云服务,还发起8万美元记忆起源大赛。
大模型学会拖进度条看视频了!阿里新研究让视频推理告别脑补,实现证据链思考 | ICLR 2026
阿里巴巴未来生活实验室团队解决多模态大模型视频推理难题,推出ReWatch数据集和ReWatch - R1模型。数据集克服现有训练数据痛点,模型用SFT + RL范式及创新奖励机制,实验成绩SOTA。
MiniMax把自家“实习生”放出来了!
曾经割裂需求、设计与代码的流水线正在消融,MiniMax上线的AI原生工作台Agent 2.0为此而来。它通过Desktop App与Expert Agents两大载体,可嵌入工作环境,现已开启封闭内测,能帮用户提升工作效率。
CMU&NYU最新工作解释:存储在权重里的“智能”是从哪来的?
论文《From Entropy to Epiplexity》指出经典信息论在AI面前有三大悖论,提出用Epiplexity度量信息。它将数据信息拆为Time - bounded Entropy和Epiplexity,通过神经网络训练近似计算,实验验证其有效性,并给出启示。
顶尖AI竟输给三岁宝宝,BabyVision测试暴露多模态模型硬伤
UniPat AI 等发布多模态理解评测集 BabyVision,测试显示多模态大模型纯视觉能力仅达三岁幼儿水平。其通过对比实验、细分任务评测,揭示模型系统性缺基础视觉能力,还给出新方向及发展建议。
Light-X来了!全球首个「镜头×光照」双控4D视频生成框架,单目视频秒变电影级
新加坡南洋理工大学等科研机构联合推出Light - X,全球首个「镜头×光照」双控4D视频生成框架。它解耦相机与光照,在扩散模型中融合,还构建Light - Syn数据管线,实验显示其效果显著优于现有方法。