「SDE评测体系」共找到 1165 篇相关文章
AI Agent 距离真正替人「全自动办公」,还有多远?
Meta、微软和 xAI 被曝监视员工操作来训练 AI,原因是真实办公中 AI Agent 表现不佳。SaaS - Bench 评测显示顶级大模型表现糟糕,智能体存在长周期任务脆弱、跨应用错误放大等问题,未来 SaaS 软件或需为 Agent 重新设计。
中国AI登顶全球之巅,顶流女团MV燃爆开场!AI音乐奇点已至
昆仑天工发布Mureka V8音乐大模型,基于MusiCoT技术,在音乐性、人声表现力和编曲层次等方面显著提升,使AI音乐达「可发布」级别,评测超Suno V5,还与太合音乐合作,欲打造全球AI音乐第一平台。
我所知道的闫俊杰
文章讲述了MiniMax掌门人闫俊杰的故事。他技术功底深厚,在商汤时提出创新算法成名。创业后,他以AGI为目标搭建人才体系,推出Glow等产品。虽面临DeepSeek竞争等困境,但坚持模型与产品一体化发展。
WRC整理床铺机器人背后模型曝光!端到端双系统全身智能VLA,仅凭少量微调就能get任务
星海图在2025WRC展示G0模型,可让机器人自主完成铺床任务。其发布端到端双系统全身智能VLA模型G0,结合真机数据集与架构,还构建开放数据集,评测结果优于π0模型,即将开源。
AI「生肉证明」堆爆GitHub!陶哲轩重磅发声:只会解题没用了
陶哲轩判断数学从证明稀缺进入过剩时代,AI 使证明生成加速,出现验证和消化跟不上的‘阻抗失配’现象。如 Erdős 问题有众多待评估方案堆积,而仅1196号案例跑通‘三件套’。他还指出学术评价体系将重写。
刚刚,豆包编程模型来了,我们用四个关卡考了考它!
2025年AI编程助手分化为IDE增强和Agentic两条路线。当前Claude Pro有使用限制,火山引擎推出豆包编程模型Doubao-Seed-Code。它在多项评测表现优异,具备长上下文等能力,经四关测试实力强,价格也实惠,或成完美平替。
万字长谈丨同济工智院华先胜:工程智能,是 AI 的「成人礼」
雷峰网·AI科技评论对话同济工智院华先胜,探讨工程智能。他认为工程智能是AI与工程深度融合,要从数字走向物理世界,构建体系,实现人机共生,还介绍了研究院成果、灵感计算及操作系统架构等。
为什么AI总是"记错"你?我们造了一个"合成人生"来测试
现有AI记忆评测只记'事'不记'人',存在数据源窄、不重理解、注入成本高的问题。QuantaAlpha联合高校团队提出CloneMem基准测试,用'数字痕迹'评估AI Clone长期记忆能力,实验有反直觉结论并给出设计启示。
GAIR Paper 107|高校联合腾讯发布 GameCraft-Bench:AI已能端到端开发游戏,Claude Opus 四成达到可玩水平
香港中文大学(深圳)等高校联合腾讯发布 GameCraft-Bench,旨在构建基于真实游戏引擎、产物完整可运行且能验证的 AI 游戏生成评测基准,解决现有基准难衡量端到端可玩性的问题,测试显示前沿模型在游戏生成上仍薄弱。
苏度 WAIC 首秀:从1到10+技能跃迁,探索通用机器人 Scaling 路径
WAIC 2026上,苏度科技机器人展示了抓取物品等技能,稳定性等表现出彩。苏度成立一年获200亿估值,其创始人苏昊等技术实力强。它构建能力积累体系,采用虚实融合数据路线,坚持软硬件一体,多场景落地成果佳。