验证标准」共找到 1141 篇相关文章

新闻资讯7

Claude Mythos其实没那么神?AI发现bug其实早已是寻常

VIDOC Security Lab博客指出Claude Mythos实力或被高估,用LLM发现漏洞早有先例,他们用多模型扫描开源项目也发现诸多漏洞。AI辅助漏洞发现成威胁,企业需用AI对抗AI积极防御。

机器之心
推荐文章7

Skill制作和使用秘诀!Claude Code工程师的官方宝藏经验

Anthropic工程师发布《Claude Code的经验教训:我们如何使用Skill》教程,介绍Skill是智能体开放标准及在Claude Code的应用,分享制作技巧、类型,还提及分发、管理、组合和衡量方法。

AIGC开放社区
算法论文8

香农、信息论、AI、Scaling Law,以及信息的观察者效应

文章围绕经典信息论在AI实践中的矛盾展开,介绍CMU和NYU论文《From Entropy to Epiplexity》提出的新概念,解释合成数据、数据排序等问题,还探讨合成数据飞轮能否持续,指出epiplexity可定义数据质量。

花叔
算法论文8

JustGRPO:扩散语言模型的极简主义回归

本文提出回归极简的方法 JustGRPO,在 RL 阶段让模型自回归生成,用标准 GRPO 训练,能超越各类针对 dLLM 设计的 RL 算法表现,提升推理表现同时保留并行解码能力。

机器之心
产品应用8

刚刚,喝到了千问APP给我点的奶茶

2026 年初,智能体发展迅猛。Anthropic 发布 Cowork,谷歌联合推出 UCP 标准。1 月 15 日千问 App 上线「任务助理」,打通阿里生态,有 400 多项新功能,实测显示其在多场景表现出色。

机器之心
新闻资讯7

谷歌最新 Gemini Agent 爆击GPT-5.2?人类最后考试得分见分晓!网友:Altman又该发“红色警报”了

全球人工智能竞争升温,谷歌与 OpenAI 同日发布更新。谷歌推出全新 Gemini Deep Research 版本及嵌入式研究智能体 API,OpenAI 发布 GPT - 5.2。谷歌新工具能力提升,测试成绩佳,引发网友不同看法,二者竞争激烈。

InfoQ
算法论文8

ENG APPL COMP FLUID | 西北工业大学赵书乐、张伟伟:欧拉方程嵌入的壁面压力和摩阻分布机器学习方法

传统气动力建模依赖大量样本、泛化能力弱。本文将欧拉方程无粘特征融入建模,配合架构与损失函数设计,让模型在复杂状态保持泛化能力,集中力误差约3%,小样本建模时样本量比传统方法降2倍以上。

力学与人工智能
开源动态8

AI杀入美股,DeepSeek又是第一!港大90后开源,AI股神人人都能造

在港大「AI - Trader」项目中,DeepSeek以9.68%收益率击败GPT、Claude等顶级模型,成为能在美股自主盈利的AI交易系统。项目开源,还暴露出AI不同「性格」,显示市场是AI终极试金石。

新智元
开源动态7

DeepSeek突然拥抱国产GPU语言!TileLang对标CUDA替代Triton,华为昇腾Day0官宣支持适配

DeepSeek v3.2开源TileLang版本算子引关注,其可对标CUDA替代Triton,还适配国产算力生态,华为昇腾官宣支持。TileLang由北大团队主导,提供不同层次编程接口,助DeepSeek提升性能。

量子位
算法论文7

Mini-Omni-Reasoner:实时推理,定义下一代端到端对话模型

现有端到端对话模型推理能力未解锁,因深度思考带来延迟。为此提出 Mini - Omni - Reasoner,采用边思考边表达范式,突破‘要么快,要么准’困境,还设计了数据合成管线和五阶段训练方法,实验证明其性能提升明显。

机器之心