「推理规划」共找到 2347 篇相关文章
一举击败Claude Code!微软提出代码生成黑科技:一键直出36K行代码
现有方法依赖自然语言规划生成仓库易失效,微软提出Repository Planning Graph (RPG),以图谱替代文字规划。基于此的ZeroRepo框架能让仓库生成可控、可扩、可验证,在新基准RepoCraft上表现远超Claude Code。
秋招超强助攻:零基础1小时上手GPT微调!全流程教程免费开源
新一年秋招季,岗位对AI能力要求提升。OpenAI发布新开源大模型GPT - OSS,博主Lorentz Yeung开源本地部署和微调训练GPT - OSS的教程,助零基础者上手,还介绍环境搭建、代码和训练前后效果对比。
LLM「拒绝回答」难题有救了!最新研究让AI学会人情世故 | COLM'25
最新研究发现模型规模和通用语言能力与处理敏感内容判断能力无直接关联,开源模型表现不错。通过提出的训练方法,在非推理和推理型模型上缓解过度拒绝问题,提升AI实用性和可靠性。
单目3DGS迎来突破:影石开源UniSHARP实现全相机适配
影石研究院发布单目新视角合成模型UniSHARP,可通过单次推理秒级获场景高斯点云,支持混合相机训练与免标定推理,适配所有相机。团队还构建数据集、设benchmark,代码等均已开源。
狙击Gemini 3!OpenAI发布GPT-5.1-Codex-Max
Gemini 3力压全场,OpenAI发布GPT-5.1-Codex-Max应对。它突破上下文窗口限制,能连续工作超24小时,在METR达新SOTA,推理更快,还推出xhigh推理力度选项,已支持与多种工具结合。
谢赛宁团队新基准让LLM集体自闭,DeepSeek R1、Gemini 2.5 Pro都是零分
纽约大学等8家机构研究者提出LiveCodeBench Pro竞技编程基准测试,评估了Gemini 2.5 Pro等前沿大模型。发现当前模型有显著不足,在无外部工具时,高难度题通过率为0,LLM与人类大师级水平差距明显。
OpenAI未公开的o3「用图思考」技术,被小红书、西安交大尝试实现了
OpenAI推出的o3推理模型打破传统文字思维链边界,实现图像融入推理过程。小红书与西安交大联合构建多模态深度思考模型DeepEyes,尝试实现类似能力,还开源技术细节,在多任务中表现出色。
2025年4月17日消息,OpenAI 连发o3和o4 mini,o3为强大推理模型,o4-mini专为高效推理优化。它们能调用ChatGPT工具,可基于图像思考。OpenAI还开源本地代码智能体Codex CLI,兼容所有模型。
大语言模型离“数学证明高手”还有多远?斯坦福、伯克利、MIT 团队提出 IneqMath 评测标准
现在很多大语言模型常给出看似正确的结论,但推理过程却有问题。斯坦福、伯克利和MIT团队提出新思路,构建IneqMath数据集及‘AI数学裁判系统’,研究发现很多模型推理不严谨,还给出两个提升准确率的办法。
对话许华哲:进家的机器人,先做好这10件事
本文是对许华哲的访谈,他离开星海图创办破壳机器人,切入具身智能C端赛道。许华哲阐述选择进家的原因、产品规划,还探讨数据来源、模型规划、强化学习等问题,分享从科学家到创业者的体验。