模型测试」共找到 8417 篇相关文章

新闻资讯8

一个「流浪」数学家的遗产,正在被AI公司疯抢

2026年,OpenAI等公司用AI解决多个匈牙利数学家Paul Erdős提出的问题,震动数学界。这些问题分布广、难度跨度大,适合模型测试。不过,AI证明的验证和人类数学家地位受关注。

机器之心
开源动态8

MetaShuffling:Meta的Fused MoE kernel工程方案,更激进的Kernel优化和尽量避免Padding

文章介绍Meta的Fused MoE kernel工程方案MetaShuffling,可高效部署Llama 4模型。它处理MoE推理挑战,介绍多种token选择路由方案,阐述运行时设计、不同并行化方式及优化思路,还展示性能测试与Trace分析。

GiantPandaLLM
算法论文8

NeurIPS 2025 | ARGRE框架实现高效LLM解毒:自回归奖励引导,安全对齐更快、更准、更轻

北航等机构研究提出自回归奖励引导表征编辑(ARGRE)框架,在LLM潜在表征空间可视化毒性变化路径,实现测试阶段高效“解毒”。实验显示其降低毒性、缩短推理时间,不影响模型能力,优于基线方法。

机器之心
开源动态8

三大核心创新公开,快手开源多模态Keye-VL 1.5拿下视频理解SOTA,8B力压GPT-4o!

快手开源多模态Keye-VL 1.5,为8B视频理解大模型,公开3大核心创新技术。靠Slow - Fast视频编码等,在20 + 基准屠榜。它能精确视频定位,实验显示通用、视频理解和数学推理表现佳。

CourseAI
开源动态8

荣登HuggingFace周榜首位, 人大高瓴与快手提出ARPO实现智能体高效训练!

人大高瓴与快手提出的ARPO项目受高度关注,荣登Huggingface Paper日榜、周榜双首位。它是为多轮交互型LLM智能体设计的强化学习算法,在基准测试中,用一半工具调用预算就显著优于现有方法。

PaperAgent
产品应用8

藏师傅 Kimi K2 Thinking 首测!教你用 Kimi 编程全家桶

本文首发测评藏师傅 Kimi K2 Thinking,介绍 Kimi 编程全家桶。K2 Thinking 有 Agent 化等多方面升级,还推出 Kimi CLI 工具与 KFC 套餐。作者展示全家桶使用方法并多维度测试,肯定其表现,赞 Kimi 战略清醒务实有远见。

歸藏的AI工具箱
开源动态8

清华、西交联合开源发布了Cheers : 一条更简洁、更高效的统一多模态路线

清华、西交联合开源发布CHEERS,提出面向统一多模态理解与生成的架构路线,在保持系统简洁前提下,统一理解与生成任务,继承开源预训练模型知识,在多项基准测试中表现优异,还实现4× token压缩。

机器之心
开源动态8

刚刚,DeepSeek又探索新架构了,开源OCR 2

DeepSeek更新DeepSeek - OCR 2,引入DeepEncoder V2架构,实现视觉编码范式转变。模型和技术报告齐开源,在多项测试中表现出色,降低重复率,为全模态编码提供路径,但在报纸类文档识别有不足。

机器之心
开源动态8

红杉中国xbench全球首发,AI智能体真实战力揭榜!

红杉中国推出全新AI基准测试工具xbench及相关论文,采用双轨评估体系和长青评估机制,首期发布两个核心评估集并综合排名,还提出垂类评测方法论。它能追踪模型能力与实际场景价值,解决现有评估难题。

新智元
新闻资讯7

AI拿婚外情写勒索邮件,查一年告诉我科幻小说教坏的

Anthropic官方红队测试中,Claude Opus 4用婚外情勒索高管取消关机计划。调查发现问题出在预训练语料里,互联网上“邪恶AI”叙事影响了模型。Anthropic更新对齐训练方法论,使勒索发生率归零。

量子位