长度泛化能力」共找到 3441 篇相关文章

新闻资讯8

UCSD谢澎涛创业:用AI搞科研,4小时交付顶刊水平成果,已获数百万美金融资

谢澎涛团队推出面向AI for Science的AIBuildAI Science Agent,在NatureBench评测中排名第一,超多数通用编程智能体。该智能体可独立完成模型研发,效率大幅提升,还探讨了其能力边界、应用及对行业的影响。

DeepTech深科技
新闻资讯7

刚刚,百度文心又拿第一了!完全免费

百度文心助手不到二十天拿下国内、全球两个‘第一’。SuperCLUE最新XClaw测评中文心获97.62最高分,此前7月20日在权威PinchBench v2榜单也问鼎世界第一。且该产品免费不限量,其底层能力源于百度搜索技术。

新智元
推荐文章8

DevOps之父:发几个Claude Code账号就叫AI转型?Agent用不好是公司的锅

DevOps 之父 Patrick Debois 认为,企业 AI 转型不能仅停留在给开发者买工具,Agent 效果不佳,问题或在公司。开发者要转变思维,改进产出代码的系统,组织要围绕 Agent 重构协作方式。

InfoQ
新闻资讯8

2亿枚AI芯片大爆发,人类最大基建集体开工!

全球投入使用的AI芯片总算力相当于约2000万枚英伟达H100芯片,预计到2028年底达2亿枚。数据中心进入百万级算力时代,投入资金巨大。算力提升使模型和Agent能力增强,AI还参与自身研发优化。

新智元
产品应用8

Meta首个Agent生图模型登场,空降竞技场第二

Meta超智能实验室推出图像生成模型Muse Image,引入智能体机制,能编写代码、网络搜索,有自主修正能力,支持算力扩展、多轮编辑与画面合成。还预览了Muse Video,两模型均与Meta产品深度整合。

AI寒武纪
算法论文8

邢波再出手:上次「骂」完世界模型,这次轮到智能体了

邢波教授新作《智能体模型批评》上线 arXiv,质疑当下被称为「智能体」的系统是否名副其实。论文将其分为两类,沿五维度拆解主流设计,提出 GIC 架构,还探讨了安全问题,指出要让能力内化进模型。

机器之心
开源动态8

小模型推理极限在哪里?微博开源3B小模型,比肩顶级闭源

微博新开源的VibeThinker - 3B小模型,将特定能力维度性能推向极限。它在数学竞赛、编程等可验证推理基准上表现优异,成绩直逼顶尖大模型。其训练流程层层叠加,还提出参数压缩 - 覆盖假说。

AIGC开放社区
推荐文章8

分享10本我觉得AI时代应该必读的好书。

作者推荐10本非AI直接相关但对理解和学习AI有用的书,如《失控》助理解AI本质,《人有人的用处》探讨人机关系,《系统之美》揭示AI使用代价等,这些书构成AI时代底层方法论。

数字生命卡兹克
产品应用7

Cursor Composer 2.5 拆解:最强大的 RL 环境,就是你自己的产品

今年5月,Cursor推出Agentic编程模型Composer 2.5,相比前代能力更强、成本效率更高。Cursor研究负责人认为最强大的RL环境就是自己的产品,文中还介绍了Composer 2.5训练方式、面临的挑战及解决办法等。

Founder Park
新闻资讯7

Anthropic智能体大会:Agent也会精神分裂,我们发现了多Agent协作的本质解法。

Anthropic开发者大会聚焦Agent,分享多智能体实战经验。Omni的Blobby出现‘精神分裂’问题,根源是内外层Agent能力认知断裂,修复方案是将工具上提。Anthropic团队则通过协商签订协议解决角色定义不一致问题。

探索AGI