「评测环境」共找到 1070 篇相关文章
北大腾讯突破奖励模型瓶颈!让AI理解人类偏好,泛化能力比肩GPT-4.1
北京大学知识计算实验室联合腾讯等机构提出RewardAnything,突破奖励模型瓶颈。它让奖励模型理解自然语言评判原则,降低成本,泛化能力比肩GPT - 4.1,还能用于定制AI行为模式。
让代码接管世界演化,西湖大学发布Code视频世界模型
西湖大学研究团队提出 Code World Model,将‘世界如何演化’和‘世界如何被看见’拆成两个互补问题,由 Coding Agent 决定世界演化,代码执行规则,视频模型转化为视觉观察,有应用潜力。
南京城之真实写照
一位南京创业者致信市委领导,指出南京虽有顶尖科教资源,却成“人才中转站”,毕业生和创业者外流严重。分析原因是发展路径偏差、政策执行打折等,还对比了杭州和合肥,最后提出发展期盼。
「重置之神」Tibo:Codex真的有一个「重置」按钮,实体的
OpenAI Codex产品负责人Tibo在播客透露重置按钮是实体。他谈了OpenAI文化、给创业者建议,还涉及AI开发流程、ChatGPT与Codex合并、额度重置原因等多方面内容。
近5w颗星!一个能同时指挥多个AI写代码的开源工具来了
现在写代码,很多人想开多个AI助手。Orca是支持多AI Agent的编程开发环境,各Agent在独立git worktree里运行,互不干扰。它功能丰富,还支持多系统安装。
泪崩!!!完啦,完啦 AI 编程,4k Star MonkeyCode!!!
现在很多AI编程工具,只让Agent“写出代码”。而MonkeyCode把AI编程任务接入完整链路,是面向专业研发团队的开源AI开发平台,本文介绍其特点、适用场景及注意事项。
AI终于“长”进机器人身体里!机械臂学会用触觉思考
香港科技大学申亚京教授团队研发出具身机器人手臂 EmArm,实现亚毫米级触觉定位与实时‘感知 - 行动’闭环。研究还提出‘感知 - 驱动’一体化算法,为打造物理 AI 机器人提供可扩展技术路径。
一个场景吃掉700MB显存!3DGS存储焦虑怎么解?这篇综述划了五个方向
过去三年,3D Gaussian Splatting(3DGS)成实时3D场景重建与新视角合成“默认答案”,但场景拓展后有显存、带宽和功耗限制。香港科大等联合发布综述,从底层数据流组织技术版图,给出优化建议和未来方向。
王炸!模型越接越乱,2.9 万 Star OmniRoute 把 290+ 个 AI 供应商压成一个入口
现在接入AI工具麻烦,换模型要改配置,额度、接口等也有问题。OmniRoute是开源AI Gateway,将多家模型供应商统一到一个入口,支持290+ providers等,可解决接入混乱问题。
刚刚,Anthropic 宣布:Claude 自己长出了意识
Anthropic新研究《语言模型中的全局工作空间》,在Claude神经网络里找到特殊区域J - space,它有独特性质,对应全局工作空间理论。还介绍了发现方法及多个实验,探讨其与意识关系,研究已开源。