「扩展思考模式」共找到 1875 篇相关文章
人类秒懂,AI崩溃:一个简单测试,就让GPT-5、Gemini等顶级模型集体“翻车”
来自多机构研究团队发现,OpenAI的GPT-5等顶级AI模型,面对‘看得见但读不懂’文字时表现极差。VYU团队实验显示,人类能轻松读懂的切分拼接文字,AI却全军覆没,原因是其靠模式匹配,不懂文字结构。
本周六直播预约 | Test-Time Reasoning综述分享!
当大模型训练成本飙升、数据枯竭,推理阶段扩展Test-Time Scaling(TTS)成研究热点。论文提出四维正交分析框架,梳理主流技术路线,提炼发展路径,给出操作指南与未来思考,本周六将直播分享该综述。
大厂代码库几百万行,Claude Code怎么跑起来的?Anthropic首次公开全套打法
Anthropic发布文章总结Claude Code在企业规模部署的最佳实践。Claude Code导航类似软件工程师,与RAG驱动工具不同。其harness由多扩展点组成,在部署中有三种常见配置模式,还给出应用建议。
隐形束缚:RLVR为何无法突破LLM的推理边界?
大型推理模型进展依赖带可验证奖励的强化学习(RLVR),但它能否扩展模型推理能力存疑。本文通过理论证明与实验,揭示RLVR存在“隐形束缚”,只能在基座模型初始能力内优化,难以发现新解。
免费开源低成本的3D动作捕捉系统
FreeMoCap是无标记点3D动作捕捉系统,用普通USB摄像头就能实现研究级全身动作捕捉,支持单/多相机模式,输出3D骨骼数据,可导入Blender等工具,具有低成本、开源可扩展等优势。
谷歌AI核爆:升级全系模型,Gemini 2.5双榜登顶!所有产品用AI重做,OpenAI如何接招?
北京时间5月21日凌晨,谷歌在2025 I/O大会发布众多更新。模型层面,为Gemini 2.5 Pro引入新推理模型和2.5 Flash;谷歌搜索推出AI模式;还亮相视频模型Veo 3,编码助手Jules公测等。
ICCV2025 | One image is all you need,多模态指令数据合成,你只管给图,剩下的交给Oasis
近年来多模态指令数据合成依赖人工设计提示词,成本高。本文提出 Oasis 方法,仅靠图像生成数据,打破传统输入模式,还开源代码库 MM - INF。实验显示其数据多样,能提升 MLLM 性能。
Anthropic实践发现:Multi-Agent系统的核心仍然是Prompt设计!
近期Anthropic分享构建多智能体研究系统最佳实践,提出8条研究智能体的提示工程与评估原则。其架构采用协调者 - 工作者模式,与传统RAG方法不同,使用多步骤搜索动态查找信息。
构建 Agent Native 软件的完整技术指南
Dan Shipper 和 Claude 联合撰写构建 Agent 原生软件技术指南,总结如何重新思考软件架构,让 Agent 成软件一等公民。指南源于实战,介绍构建原则、方法、执行模式等,还提及产品影响、移动端挑战及应对。
Gamma 创始人:小团队创业是共识,怎么做好才是最大的问题
AI创企Gamma 30人服务近5000万用户,ARR超5000万美元且持续盈利。创始人Grant Lee分享创业心得,包括小团队组织模式、重视通才、可持续业务理念、组织创新及应对PMF等问题的思路。