推理模型瓶颈」共找到 8413 篇相关文章

新闻资讯8

刚刚,谷歌摊牌:Genie 3让你1秒「进入」名画,人人可造交互世界!

谷歌新发布Genie 3世界模型,能从文本生成交互式AI空间世界,操控图像和视频。用户可进入《苏格拉底之死》《夜游者》等名画探索,还能利用它训练3D模型,实现沉浸式体验。

新智元
产品应用7

VC开始靠AI预测未来了

七月,DigClaw的预测框架Rhizome v1在FutureX评测平台取得优异成绩,支持了预测能力可沉淀在基座模型之外的判断。大语言模型不擅长预测,而DigClaw构建了以因果结构为骨架的预测基础设施。

量子位
产品应用8

GPT-Image-2正式发布!设计师可以告别「古法设计」了

OpenAI正式发布ChatGPT Images 2.0(GPT - Image - 2),它是首个具“思考”能力的图像模型,处理复杂任务能力强,实测在商品广告、论文海报等场景表现出色,已全量上线,在大模型竞技中领先。

量子位
开源动态7

无需租GPU,一台24GB内存的笔记本就够了!

阿里开源稀疏 MoE 模型 Qwen3.6-35B-A3B,总参数 35B,激活 3B。它在智能体编程上超越前代,可与稠密模型媲美,支持多模态,已在 Qwen Studio 上线,还能集成第三方编程助手。

GitHubStore
新闻资讯7

Cursor滑跪开源技术报告:Kimi基模这样微调能干翻Claude

Cursor放出Composer 2技术报告力证‘自研’,基于Kimi K2.5经持续预训练和异步强化学习,测试表现好。同时,杨植麟分享Kimi团队最新思考,认为大模型要规模化,断言大模型训练进入第三阶段。

量子位
产品应用7

GPT-5超越人类医生!推理能力比专家高出24%,理解力强29%

最新研究显示,GPT - 5在医疗领域处理多模态信息能力出色,在多模态测试中推理和理解得分比GPT - 4o分别提高近30%和36%,比人类医生还高。其能力提升源于端到端多模态架构,但现实应用还需更多实战考验。

量子位
算法论文8

长程任务飙升98%,斯坦福Skill原生LLM来了

普林斯顿、CMU、斯坦福、牛津等提出Skill-Native大模型,提出Skill Entropy度量技能切换难度,搭建Skill²-Bench评测,还将熵用作训练信号提出Skill-Entropy RL,提升多模型准确率,且技能熵可复用。

PaperAgent
算法论文7

1美元Token撬动4800美元收益!AI挑战百万美元级基准,最赚钱的Agent出现了

Humanlaya Data Lab等机构构建$OneMillion - Bench评测基准,用经济价值衡量模型。它含400道高难题目,覆盖多领域。目前最强模型能产出约50万美元价值,但离可交付专业任务还有距离。

机器之心
算法论文8

思维锚点:破解LLM Reasoning黑箱的关键句

文章提出思维锚点概念,指推理轨迹中影响后续步骤和答案的关键句。开发三种归因方法,系统论证高级组织句影响力更大,锚点主导错误修正。研究为理解LLM推理机制开辟新途径,开源工具支持可视化分析。

深度学习自然语言处理
产品应用8

字节Seed最新版原生智能体来了!一个模型搞定手机/电脑/浏览器自主操作

字节Seed发布最新版原生智能体UI - TARS - 2,采用All in one原生设计,表现优于Claude和OpenAI Agent等。它通过多轮强化学习,解决智能体操作图形界面的四大难题,在多测试中表现出色。

量子位