「智能体评测」共找到 3914 篇相关文章
医疗领域DeepSeek时刻:蚂蚁 · 安诊儿医疗大模型正式开源,登顶权威榜单
2026 年初,OpenAI 报告显示不少人用 ChatGPT 咨询医疗问题,还发布了 ChatGPT 健康。近日,蚂蚁集团等开源的蚂蚁・安诊儿医疗大模型或成最优解,它参数量大,在多评测中登顶,技术优势明显。
浙大联手字节:开源大规模指令跟随视频编辑数据集OpenVE-3M
浙江大学与字节跳动合作,提出大规模指令跟随视频编辑数据集 OpenVE-3M,有 3M 样本对。还提出数据构造管线、编辑模型 OpenVE-Edit 及评测集 OpenVE-Bench,小参数量下超越现有开源模型。
14000人原地被裁!亚马逊今日:打工人水深,AI机器人火热
10月28日,亚马逊约1.4万名员工收到裁员通知,占全职员工4%,超80%来自零售业务。公司业绩不错仍裁员,是为用AI增效、资源重组,还押注具身智能,或取代超50万蓝领岗位。
清华团队开源发布首个结构化数据通用大模型
2025年8月29日,清华崔鹏教授团队联合稳准智能开源“极数”(Limi X)结构化数据通用大模型。它融合结构因果推断与预训练技术,适配多任务,性能超最优专用模型,已落地多个工业场景。
人工智能研究者如何意外发现:我们对“学习”的理解,可能全是错的
传统理论认为大模型会过拟合,而如今大模型却驱动了诸多应用。2019年研究者突破传统扩大模型规模,出现‘双下降’现象。‘彩票假说’解释其成功原因,还重新定义了‘智能’,揭示科学进步规律。
清华计算机女神,冲刺IPO了
清华计算机系女神庄莉创办的镁佳科技,完成招股书提交,开启IPO冲刺,目标港交所主板上市。镁佳主打智能座舱集成式域控解决方案,虽业务增长,但面临竞争挑战,2024年营收14亿、亏损2.9亿。
xAI 22岁天才华人研究员:我们正以一敌十,Grok 4将无与伦比!
马斯克宣布Grok 4将在7月4日后发布,xAI华人研究员李天乐放豪言,称Grok 4智能无与伦比,且他们一人顶其他实验室10人。网友对此反应不一,马斯克也肯定Grok 4运行结果。
OpenAI o1功臣预警:AI还没失控,我们已经快测不准它了!
本文为新智元报道,OpenAI o1推理研究核心贡献者Daniel Selsam公开预警,AI尚未失控,但人类评估AI安全性的能力已退化,模型可伪装安全,曝光OpenAI内部AI事故,呼吁建立独立评测机制。
3D指标超过Nano Banana Pro!浙大开源方案让AI在平面图像里进行立体编辑 | ACM MM'26
当前图像编辑模型处理三维状态常出错。浙江大学ReLER团队提出并开源PhyEdit,用显式3D几何preview指导图像编辑,还加入深度监督,构建数据集和评测基准,成绩超Nano Banana Pro,且GUI也开源。
直面LeCun愿景,智在无界发布最强具身世界模型,20万小时人类视频屠榜6大榜单
智在无界作为人类视频学习路线开创者,4月14日发布第三代旗舰模型Being - H0.7,用20万小时人类视频训练,提出新范式,在6项权威评测中综合排名全球第一,拓展了世界模型能力边界。