「模型行为团队」共找到 9234 篇相关文章
一个For循环就是全部:BU开源了它的Agent框架
Browser Use团队开源bu - agent - sdk,设计理念简单,Agent就是一个for循环。它减少抽象、最大化模型自由度,解决了传统框架行动空间不完整等问题,支持多模型,开发者可自由选模型。
别被室内基准高分骗了:大模型是在推理空间,还是在「背答案」?
2025年,空间智能成大模型竞争新热点,模型在室内基准上分数飙升。但因训练与测试数据同源,其提升或只是“背答案”。中科院大学等机构发布OSI - Bench重新审视大模型空间能力,评测显示当前提升可能是虚假繁荣。
从网页截图到精准复刻只需30秒:这个新模型刷新了我的认知
智谱AI发布GLM - 4.6V系列模型,是首个支持工具调用的视觉模型。作者对其进行7个场景测试,如识别鸟类、分析赶海地点等,展现出不错性能。该模型速度快、开源,有优势也有小问题,适合开发者和普通用户。
具身智能奇点已至!超越π*0.6,极佳视界自我进化VLA大模型拿下世界第一
极佳视界具身大模型 GigaBrain-0.5M*依托世界模型实现自我进化,在多真实任务近 100% 成功,超 π*0.6 成 SOTA。其提出基于世界模型的强化学习范式,用超万小时数据训练,推动通用具身智能发展。
突袭Cursor,Windsurf抢发自研大模型!性能比肩Claude 3.5、但成本更低,网友好评:响应快、不废话
当地时间5月16日,Windsurf推出首个AI软件工程模型家族SWE - 1。此系列含三款模型,性能比肩Claude 3.5且成本更低。开发者试用评价不错,但也指出存在幻觉问题。Windsurf旨在提升软件开发速度,后续将持续投入。
NeurIPS 25开新坑:145万个图文对,覆盖八种主流水下理解任务
华中科技大学团队推出首个水下多模态大模型NAUTILUS,支持8种水下场景理解任务,还开源145万图文对的NautData数据集。模型通过VFE模块解决水下图像问题,性能超越现有模型,恶劣环境表现更佳。
OpenAI去年挖的坑填上了!奖励模型首现Scaling Law,1.8B给70B巨兽上了一课
全新奖励模型「POLAR」采用对比学习范式,摆脱对海量人工标注依赖,有强大Scaling潜力。它衡量训练与目标策略「距离」作奖励信号,用自动化合成数据预训练,小模型能超越大数十倍规模对手。
走出 MMLU 的高分幻觉:AI Agent 的「斯坦利时刻」与职场生存法则
文章指出多模态大模型在基准测试分数高,在实际业务流程却像‘职场巨婴’。研究团队构建Trainee - Bench测试顶尖模型,结果显示模型离‘独立上岗’远,凸显提升Agent自主学习性的重要性。
庞若鸣还有苹果论文?改善预训练高质量数据枯竭困境
苹果基础模型原负责人庞若鸣在 Meta 任职期间,其在苹果参与的高价值研究仍不断发表。研究团队针对大模型训练中高质量数据枯竭问题,提出 Synthetic Bootstrapped Pretraining (SBP) 预训练流程,提升模型性能。
英伟达揭示RL Scaling魔力!训练步数翻倍=推理能力质变,小模型突破推理极限
学界对强化学习能否让模型学会新推理技能争论已久,过去研究多悲观。英伟达研究指出,问题源于任务在基础模型训练数据中过度呈现及训练步数不足。其ProRL框架提升训练步数,释放小模型潜力,还构建技术组合拳。