核心认知基准」共找到 2692 篇相关文章

推荐文章7

前 DeepMind 研究员反思:评测,而非算力或数据,才是下一阶段的瓶颈

前 Google DeepMind 高级研究员 Lun Wang 在技术长文中指出,当前主流评测体系滞后,静态基准会“安静失效”。作者主张引入序参量,呼吁构建自演进评测,还为一线工程师提供了研发建议。

深度学习自然语言处理
新闻资讯7

专访哆咪漫剧安培:投流2亿后,AI漫剧的真相和真话

2026年AI漫剧爆发,哆咪漫剧团队投流2亿。创始人安培称行业处上行期,竞争门槛抬高。AI降低创作门槛,但商业生存门槛提升,核心竞争力回归商业本质,还分享制作、发行等多方面看法。

鲸选AI
新闻资讯7

OpenAI谷歌Anthropic罕见联手发研究!Ilya/Hinton/Bengio带头支持,共推CoT监测方案

OpenAI、谷歌DeepMind、Anthropic联合发表立场文件,提出CoT监测概念,认为是控制AI Agent核心方法。探讨其潜在机遇、局限,还提及不同公司对CoT监测的不同态度,如OpenAI乐观,Anthropic焦虑。

量子位
产品应用8

“图片秒生”,腾讯混元图像2.0模型正式发布,主打速度和真实感

5月16日,腾讯发布混元图像2.0模型,率先实现实时生图,生图速度快、质量高,能避免‘AI味’。在GenEval基准上准确率超95%,还发布实时绘画板功能,后续将推原生多模态模型。

AI科技大本营
算法论文7

AI如何看懂足球?上海交大团队打造Multi-Agent系统,全面解析“美丽足球”!

现有足球AI研究存在不足,上海交大团队打造Multi - Agent系统。他们构建SoccerWiki知识库、SoccerBench评测基准和SoccerAgent多智能体系统,该系统多工具协作,实验中碾压GPT - 4,数据和代码将开源。

深度学习自然语言处理
新闻资讯8

“我不想一辈子只做PyTorch!”创始人8年封神后宣布卸任,AI 圈进入接班时刻

11月6日,PyTorch创始人Soumith Chintala宣布卸任框架负责人并离开Meta。他回顾了PyTorch的发展,称其已成为AI研发核心支柱。他8年升至副总裁,还讲述了PyTorch开源成功路,未来将从头做小事。

InfoQ
算法论文8

Evaluation is All You Need:评估设计的微小差异如何扭曲结果

论文以DeepSeek - R1 - Distill系列模型为例,指出大模型评估中看似客观的基准测试结果对评估细节极度敏感,细微评估条件变化会致分数波动大,削弱模型对比可信度,呼吁建立新评估标准。

深度学习自然语言处理
开源动态7

Coding Agent 的一个啊哈时刻

作者翻用Codex在SGLD做Qwen - Image/HunyuanVideo的modelopt fp8支持的记录,发现Coding Agent思考过程与人类思路高度一致,如对比中间图和结果图判断量化精度,Infra领域核心技能或被其解决。

GiantPandaLLM
算法论文8

OpenClaw代码越改越崩?新研究EvoClaw揭示:Agents持续开发成功率仅13.37%

USC邓港大等联合发布评估基准EvoClaw,揭示AI在持续开发场景下表现不佳,成功率仅13.37%。研究还指出当前评测易高估AI能力,提出DeepCommit重构演进历史,分析各模型在持续演进中的局限与问题。

量子位
新闻资讯7

GAIR Live 预告|从 IROS 2025,看智能机器人前沿趋势

IROS 2025 近日在杭州闭幕,作为全球机器人领域盛会,展示具身智能新突破与方向。GAIR Live 将携手学者与产业领军者,通过线上直播解读其核心趋势,拆解研究范式转向,还设有多个热门话题探讨。

AI科技评论