「基准测试平台」共找到 3301 篇相关文章
Meta全开源HumanCLAW:基础模型正进入具身智能的决策层
过去基础模型主要理解和描述物理世界,如今开始进入机器人控制栈。Meta等提出HumanCLAW,将高层行动与低层运动控制分开。评测显示当前模型在行动决策上存在不足,未来可从多方向推进研究。
Claude后台接管电脑,真·赛博替身!人机并行时代来了
Anthropic宣布全面升级Claude「计算机使用」能力,操作可在后台完成。该功能处于Beta测试,已向Claude Pro和Max订阅的macOS用户开放。Claude此次更新覆盖多场景,人机并行时代或来临。
70亿美元!全球最大「Token中转站」OpenRouter被收购
据Bloomberg爆料,16日Stripe敲定收购OpenRouter,超70亿美元。其创始人有成功经验,平台凭借统一API聚合AI模型受开发者青睐,业务增长快,已成AI行业“温度计”,Stripe借此掌控AI调用收支口。
AI 能力越来越强,那么它生成的代码,人类还需要去理解吗?
《代码整洁之道》作者罗伯特·C·马丁不逐行看 Agent 代码,设好测试框架通过就行。Notion 工程师 Geoffrey Litt 在会议探讨人类是否需理解代码,多数人认为需要,Litt 分享理解代码方法。
当「变大」不再是唯一的路,又一国产模型开源了
2026年6月智谱开源GLM - 5.2,心洲科技前沿实验室Mind Lab开源Macaron - V1,基座升级至GLM - 5.2。它押注持续学习与群体智能,成绩优于基座,相关理念和工程路径获验证。
满分的「差」,Qwen与复旦等揭示编程智能体奖励设计的结构性困境
Qwen团队与复旦等联合发表论文《The Verification Horizon: No Silver Bullet for Coding Agent Rewards》,指出编码智能体奖励设计存在结构性困境,任何奖励信号只是人类意图的‘替身’,验证需成系统与智能体协同演化,并研究多种验证者。
从需求到设计到代码,一个软件全搞定!TRAE Work Design实测来了
TRAE Work上新Design模式,与Work、Code模式配合,实现需求、设计、代码全链路在一个平台跑通。它能识别提取设计系统,提供多种改图方式,且出图合规、改图顺手,还简化了工作流。
80%代码由Claude合并,Anthropic内部人员点破Agent真相:「Close the Loop」
Anthropic团队研究产品经理Theo演讲指出,Claude已深入其工程流程,超80%代码由它合并。模型角色转变,能力提升,失败率下降。开发者应升级研发战术,如刷新评估基准、精简“脚手架”、闭环设计。
7300 人收藏的 PraisonAI,5 行代码即可部署 24 小时 AI 智能体团队!
PraisonAI是开发者Mervin Praison开源的全功能多智能体运行框架,有7.3K+ GitHub星标。它开发门槛低,支持100+大模型,具备完整智能体能力,还能可视化编排、一键接入聊天平台。
星火燃动海淀!投海Tech Show即将登场,提前解锁创新「星火」档案|甲子光年
4月23日投海Tech Show将在海淀启幕,拒绝形式主义,以真实内容和沉浸式体验展示前沿科技。众多创业者携项目而来,涵盖AI、硬科技等领域,现场还有互动环节,选出最“夯”项目。