AI大模型」共找到 13957 篇相关文章

算法论文7

正确答案 ≠ 正确推理,CoT 或成模型推理能力停滞的「罪魁祸首」?

研究指出当前模型推理能力评估多关注答案准确性,忽视推理步骤。通过对前沿模型测试发现,2023 - 2024 年模型推理能力提升停滞,进步靠提示工程,自底向上策略最有效。

AI科技评论
新闻资讯8

Fable 5夺冠!全球18顶尖AI自主科研赛,逼近人类极限

Prime Intellect公开规模AI自主科研实验,18顶尖模型断网8天挑战nanoGPT优化器速通,Fable 5追平人类82%的水平,AI开始独立完成科研闭环,但目前尚无模型有全新方法。

新智元
8

“10周的工作量,AI只用4天!”Anthropic发布会全程实录:你引以为傲的复杂工程,在模型眼里只是个玩具

Anthropic举办‘Code w/ Claude’开发者会,指出AI模型能力呈‘指数级’增长,多数企业开发模式却停留在‘线性’阶段。会祭出三杀手锏,包括更强底层模型、Claude Platform代理编排能力和Claude Code桌面端。

AI科技大本营
算法论文8

模型化身苏格拉底:通过主动提问挖掘人机协作的深度

微软与南加州学联合团队研究揭示激发模型主动提问能力新范式。通过定义主动信息收集任务、提出强化微调策略,经实验验证该方法有效,使模型在多领域表现出色,重新定义模型角色。

AIGC开放社区
开源动态8

小红书发布FireRedChat:首个可私有化部署的全双工模型语音交互系统

小红书智创音频团队推出业内首个支持私有化部署的全双工模型语音交互系统FireRedChat,可将半双工链路升级为全双工,提供级联与半级联服务,在多指标领先,让AI有“人感”。

机器之心
新闻资讯7

AI圈深夜乱斗!OpenAI、谷歌、Anthropic发布新模型,集体翻车?

昨晚,OpenAI时隔六年再次开源`gpt-oss-120b`和`gpt-oss-20b`,Anthropic发布`Claude Opus 4.1`,Google发布Genie 3及写故事书功能。不过OpenAI模型幻觉率高,Anthropic更新提升有限。

探索AGI
算法论文7

模型刷数学题竟有害?CMU评估20+模型指出训练陷阱

CMU团队评估20多个模型,发现只有强化学习(RL)训练的模型能将数学推理技能广泛迁移到其他任务,监督微调(SFT)训练的模型迁移有限甚至无迁移。研究还探索差异原因,表明RL微调更具优势。

量子位
开源动态8

CVPR 2026 | AI寒武纪时刻?字节世界模型新作,仅靠视觉学习真实世界知识

豆包模型团队与北京交通学联合提出视觉世界模型 “VideoWorld 2”,无需依赖语言模型,仅靠视觉信息让机器掌握复杂能力。它能完成复杂手工任务,成功率远超主流模型,代码与模型已开源。

机器之心
新闻资讯8

模型到智能体:50+ 头部企业的 AI 进化实践

2025年AICon全球人工智能开发与应用会6月27 - 28日在北京举办,50余家机构专家围绕AI Agent等前沿技术探讨落地实践与趋势。极客邦等企业代表分享应用布局,还有5主题演讲、14个技术专场和50多个标杆案例。

InfoQ
开源动态8

告别AI胡说八道,Meta新方法CoVe准确率飙升 28%

模型‘幻觉’问题一直是‘严肃使用场景’的难题。Meta AI团队提出CoVe新方法,让模型学会‘自我反省’。该方法通过四步走实现自我纠错,能幅降低幻觉率,还具备三优势。

CourseAI