「推理执行」共找到 2531 篇相关文章
Claude Code 网页版曝光, 留给 Lovable 和 Manus 们的机会,可能,不多了
网友发现Claude Code网页版选项,虽被Anthropic撤回,但功能已曝光。它有三种安全级别,处于研究预览阶段,界面功能完整,欲打造云原生开发平台,或改变编程方式,也让竞品压力增大。
景不动人动,MLLM如何面对「移步换景」的真实世界?OST-Bench揭示多模态大模型在线时空理解短板
上海多所高校研究者提出 OST - Bench,从智能体探索场景动态在线视角挑战大模型能力。它更贴近真实世界,揭示主流多模态大模型在线时空理解短板,为未来模型发展指明方向。
节前重磅:开源旗舰模型新SOTA,智谱GLM-4.6问世
国庆前智谱AI发布新一代旗舰模型GLM-4.6并将开源,它在多方面提升,如编码、上下文长度等,评测性能佳,token消耗降低。经实测,其代码、研究、开发等能力强,成全球开源AI领域重要力量。
重磅!Claude Sonnet 4.5发布,可连续编程30小时,Claude Code同款构建工具也开放了
Anthropic发布Claude Sonnet 4.5,官方称是全球最强代码、复杂智能体构建及擅用计算机的模型。伴随产品全家桶升级,还开放Claude Code构建工具,发布Imagine with Claude。该模型能力强且更安全。
Meta CTO打脸扎克伯格:首秀翻车全因致命bug,AI智商捉急、语音交互全面崩盘
Meta Connect开发者大会上,Meta发布三款智能眼镜,现场演示却屡屡翻车。扎克伯格归咎于Wi-Fi,CTO Bosworth否认,称是资源管理失误和软件bug所致,但网友对此解释并不买账,质疑团队能力。
告别胶水代码,5倍飚速!无问芯穹首次揭秘,Infra智能体蜂群登场
无问芯穹推出基础设施智能体蜂群,这是新一代基础设施智能化解决方案。它封装多个智能体模块,构建全生命周期智能闭环,提升资源利用率等。在重点客户业务流程落地效果好,能让开发者解放价值。
VerlTool重塑Agentic RL的训练生态
当前LLM像‘缸中的大脑’,缺乏与外界互动能力。新范式ARLT兴起,但构建训练框架面临诸多挑战。VerlTool作为统一、模块化、高效的开源框架应运而生,解决难题,在多任务实验表现出色,推动LLM向智能体转变。
阿里 Qoder 把这层 AI 编程的窗户纸捅破了
2025年大模型下沉到应用层,浏览器和编程工具被重新发明。阿里新发布的Agentic编程平台Qoder,增强对巨大代码工程理解能力和代码生成准确率,其上下文工程观是突破,新引入的Quest Mode很独特。
仅靠5000+样本,全新强化学习范式让30B轻松击败671B的DeepSeek V3
传统强化学习在创意写作领域举步维艰,蚂蚁技术研究院联合浙江大学开源全新强化学习范式Rubicon,构建10000+条「评分标尺」,拓展应用至主观任务领域,其30B模型用5000样本超越671B的DeepSeek V3。
波士顿动力Atlas人形机器人再现逆天进化:通用AI机器人真的要来了
波士顿动力为Atlas人形机器人训练全新大型行为模型LBMs,它是语言指令驱动的策略模型,能完成复杂操作任务。构建模型有四步骤,实践遵循三大原则,还展示了其多方面操作能力与特点。