真机评测」共找到 1063 篇相关文章

新闻资讯8

阿里安全AGI一次发布3款LLM,8B多维度领先GPT-5.4

近期,阿里安全AGI实验室发布3款Yuvion LLM,在AI安全与内容安全领域多维度领先。它以‘对抗即智能’为原则,构建五类数据体系,采用三阶段训练范式,通过YLRE四级评测体系验证能力。

PaperAgent
开源动态8

刚刚,杨植麟亲自开源Kimi K2.5!国产大模型打架的一天

今天国产大模型热闹非凡,Kimi更新至K2.5版本。它是万亿参数的MoE基础模型,开源且在多项评测表现佳,视觉与编码能力强,还引入Agent Swarm功能,实测展示其解决各类复杂任务能力。

机器之心
算法论文8

为防AI刷题,Nature等顶刊最新封面被做成数据集,考验模型科学推理能力|上海交通大学

上海交通大学王德泉教授课题组提出MAC基准,用顶级期刊最新封面构建测试集,评测多模态大模型能力。研究设计两种含“语义陷阱”的测试任务,发现顶尖模型有局限,还提出DAD方法提升表现,采用双重动态制。

量子位
开源动态8

Nanbeige4.2-3B:探索通用Agent小模型

在模型越做越大的当下,推理成本成了影响Agent大规模使用的关键因素。南北阁实验室推出Nanbeige4.2 - 3B,在架构、数据构造和训练pipeline层面做了系统工作,评测表现良好,还探索本地个人助手等应用。

AIGC开放社区
新闻资讯8

振臂一挥,大半个具身器人圈都来了!智源研究院:别藏了,谁贡献数据多,谁的大脑就更好用

2025智源具身智能Open Day上,智源研究院院长邀厂商共享数据,称谁家贡献多,具身大脑在其器人上更好用。智源无商业包袱,开源数据、统一评测,布局具身大小脑体系,欲做具身智能“安卓”。

量子位
开源动态8

32B 稠密模型推理能力超越 R1?中国秘密 AI 团队发布推理小模型 AM-Thinking-v1

2025年,国内神秘A - M - team在Hugging Face开源32B推理模型AM - Thinking - v1。它在多推理评测中击败DeepSeek - R1,与超大规模模型成绩相当。团队靠后训练方案挖掘32B模型潜力,探索小体量实现大能力路径。

AI科技评论
新闻资讯7

“英伟达显卡就是一坨*”!博主6000字檄文怒批:烧接口、缺单元、驱动变砖还威胁媒体

博主Sebin发布近6000字檄文批判英伟达,指出其显卡有烧接口、缺单元、驱动变砖等质量问题,销售策略存在库存少、黄牛多、捆绑销售等问题,还试图操控媒体及评测构。文章在Hacker News引发大量讨论。

量子位
产品应用8

全球首个通用决策大模型,AI推演现实世界的技术揭秘

中科闻歌决策Decitron被称为「全球首个通用决策大模型」,它将不同能力统一到开放世界决策框架,形成闭环。8月3日其技术报告发布,公开三项核心技术,还介绍了推演流程和实验验证情况。

机器之心
8

李曼玲、李飞飞、吴佳俊等联手:评估具身大模型的新范式!

全新的具身模型空间能力评估范式Theory of Space突破传统局限,考察模型在动态环境构建、修正和利用空间信念的能力。该论文被ICLR 2026接收,研究对前沿多模态大模型评测,揭示其空间认知能力边界。

新智元
算法论文7

UniSteer用械臂「拼豆」:让人类指导进入VLA噪声空间强化学习

视觉 - 语言 - 动作模型(VLA)是器人操作重要基础模型,但复杂任务成功率低,强化学习成本高。微软等构研究者提出 UniSteer,将人类纠正转换成噪声监督,在多任务测试中提升了成功率。

机器之心