「测试方法」共找到 3049 篇相关文章
ICML26 | 浙江理工大学马啸讲师和南京大学李武军教授课题组联合提出EMCES:为强化学习合成更有价值的样本
强化学习获取高质量样本成本高、风险大,现有基于扩散模型的样本增强方法有局限。浙江理工大学马啸讲师和南京大学李武军教授课题组提出 EMCES,将情景记忆机制引入可控扩散模型,提升下游强化学习算法表现,论文已被 ICML2026 录用。
刚刚,全球最难考试惊天大反转!黑马AI冲破36%,顶流模型集体翻车
ARC-AGI-3测试中,顶级大模型Opus 4.6仅得0.2%,人类获满分。而Symbolica公司用Agentica框架首日就取得36.08%的成绩。该框架有独特技术路径和策略,但成绩未经验证,ARC-AGI-3被视为通向AGI的‘北极星’。
国产物理AI黑马杀出!超越GPT与斯坦福Biomni,狂揽生物制造SOTA
恩和科技发布全球首个面向生物制造的物理人工智能平台 SAION AI,打破大模型只能虚拟辅助的刻板印象。它有认知、控制与闭环执行三层架构,在多项测试中表现领先,具备多方面核心优势,推动生物制造进入智能工程时代。
ChatGPT开测广告!OpenAI终于向“钱”看
OpenAI宣布在美国免费版及Go版测试ChatGPT广告功能,称是为支撑免费用户使用。广告不影响回答内容,会注明“赞助内容”。此外,新发布的GPT - 5.3 - Codex广受好评,还将推新聊天模型,其融资计划也在升温。
扒光谷歌Gemini 2.5:一份官方“翻车报告”,揭露AI Agent的8个秘密。
谷歌DeepMind发布Gemini 2.5技术报告,以玩《宝可梦 红/蓝》为例,展示构建有效智能体的案例。该系统架构由多部分组成,但运行状况百出,如上下文过长变差、产生幻觉等,也有亮点,还能提炼避坑方法。
Meta提出Deep Think with Confidence:几乎啥都不用动,就能提升推理的准确性与效率
传统自一致性方法虽能提升推理准确率,但计算开销大、收益递减。Meta AI与UCSD团队提出Deep Think with Confidence(DeepConf),可在不增训练成本和不调超参数下,提升推理准确性与效率,本文对其全面解读。
Claude Sonnet 5 上线一日差评刷屏:打不过千问和 Minimax,性价比全面翻车
Claude Sonnet 5发布一天差评多。虽官方定位高,有能力亮点,但在中文测评中性价比低,测试成本高,且Max推理模式易过度思考。还因过度保守失去实用价值,其表现取决于使用场景和预算。
GPT-5.2技术炸场!6大核心突破,办公效率拉满
OpenAI凌晨发布GPT-5.2,把专业级AI门槛拉到新高度。它有6大核心技术突破,精准戳中职场痛点。在GDPval基准测试中表现出色,有三级模型矩阵,不同版本满足不同需求,各方面能力均有显著提升。
这些大神在Meta的论文看一篇少一篇了
田渊栋团队剖析可验证奖励强化学习(RLVR)训练动态,戳破参数更新稀疏误区,提出三门理论说明其参数更新定位机制,还为RL训练算法设计提供指导,指出SFT时代参数高效微调方法在RLVR中迁移效果差。
Vercel CEO爆Kimi K2智能体准确率超GPT-5 50%?国产的风还是吹到了硅谷
Vercel CEO称内部测试中,国产Kimi K2模型运行速度和准确率均优于GPT - 5和Claude Sonnet 4.5。硅谷多家公司已接入或转用K2,K2 Agent能力也经受住检验,还给出使用和价格相关信息。