「CoT - Self - Instruct」共找到 109 篇相关文章
让 AI 自己打怪升级,Meta用Self-play RL把Coding推向超级智能
Meta FAIR、Meta TBD Lab等朝着“超级智能软件工程Agent”迈出第一步。SSR让大模型零人类标注,靠自生成Bug和自修复稳定碾压人类数据基线,新旧范式对比优势明显,还介绍方法、实验结果与理论洞察。
谷歌提出破局Self-Consistency计算瓶颈!LLM推理效率革命,推理加速不牺牲精度
Google Research等团队提出CISC,通过给推理路径赋予置信度权重,少量样本即可超越传统自洽性效果,平均减少40%计算成本,还提出WQD指标揭示模型自评估能力本质。
10倍加速化学推理大模型!Haven团队在隐空间思考分子式,碾压显示CoT
Haven团队提出LatentChem,把化学推理从‘文本表面’挪到‘模型内部’,先在隐空间思考,再在语言空间回答。它拆分‘推理’与‘表达’,性能优异,为AI Scientist奠定基础。
细粒度视觉推理链引入数学领域,准确率暴涨32%,港中文MMLab打破多模态数学推理瓶颈
香港中文大学MMLab团队发布MINT - CoT视觉推理方案,解决多模态数学推理难题。它引入特殊Interleave Token,构建专属数据集,采用三阶段训练策略,实验效果全面超越现有方法。
Qwen3接连放出No Thinking, Thinking两大模型,Gemini2.5 pro顶不住啦
Qwen推出非推理模型`Qwen3 - 235B - A22B - Instruct - 2507`后,又放出推理模型`Qwen3 - 235B - A22B - Thinking - 2507`。非推理模型在多方面功能增强,推理模型能力强,超DeepseekR1,可试用。
Sora2还在5秒打转,字节AI生视频已经4分钟“起飞”
字节和UCLA联合提出Self - Forcing++方法,无需更换模型架构或重收集数据集,就能生成分钟级长视频,最长达4分15秒,高质量且开源,在长、短时长生成上性能领先。
Evolvent AI 胡梦康:Agent 可能会被模型吃掉,但帮助 Agent 进化不会
Evolvent AI 创始人胡梦康认为 AI 下一阶段是让模型自主迭代。公司搭建 Self - Evolving Agent Infrastructure,希望成 Agent 进化的数据基础设施供应商。胡梦康分享研究历程、对 Agent 方向判断及公司业务,探讨 Agent 数据等问题。
ICLR 2026|UIUC:一行代码彻底解决LLM推理的过度思考!
2025年DeepSeek发布推理大模型,引发RLVR研究热潮,但该方法有“过度思考”问题。伊利诺伊大学香槟分校等研究者提出Self - Aligned Reward(SAR),能提升推理准确度和效率,有望推动大模型推理系统发展。
DeepSeek R2没来,DeepSeek R1+来了~
DeepSeek官方发布通知,DeepSeek R1模型完成小版本升级成DeepSeek - R1+。PaperAgent实测近1000行代码无错,网友测试显示CoT有显著变化、前端审美提升,还提及DeepSeek - R2可能快来了。
ACL 2025 | 大模型乱试错、盲调用?KnowSelf让智能体有「知识边界感知」能力
ACL 2025 论文《Agentic Knowledgeable Self-awareness》聚焦提升智能体「知识边界感知」能力。KnowSelf 方法让智能体自主调节知识运用,实验显示其性能优,还探索了智能体自我认知多方面影响。