「工具链式推理」共找到 3780 篇相关文章
中科院联合清华等发布视觉语言行动推理模型VLA-R1,让机器人先思考再行动
中科院自动化所、清华和GigaAI联合发布视觉 - 语言 - 行动模型VLA - R1,让机器人先思考再行动。它通过构建数据集教模型思维链,结合监督微调与强化学习提升性能,经多场景测试表现出色。
视觉领域的GPT-3时刻!DeepMind首次证明Veo3模型实现对物理世界建模和推理
谷歌DeepMind研究团队论文显示,视频模型Veo 3学会‘无师自通’,能处理多种没学过的视觉任务。研究人员将其能力分四级,还做了定量评估。研究认为机器视觉或正处范式转变边缘。
AI 画图不是玩具,而是可以变成效率工具 | 豆包 P 图Seedream 4.0 效率场景挖掘
作者测试豆包P图Seedream 4.0,发现它有对指令深度意图理解等能力且中文支持好。还分享用其提升效率的场景,如制作封面图、翻译图片文字等,也给出发掘AI应用场景思路和写画图提示词方法。
奥特曼深夜官宣:OpenAI重回开源!两大推理模型追平o4-mini,号称世界最强
OpenAI深夜推出gpt-oss 20B和120B两款开源模型,性能比肩o3-mini和o4-mini,能在消费级显卡甚至手机运行。有宽松许可证等亮点,还准备了体验网站。这是自GPT - 2后首次开源,降低了部分群体准入门槛。
狂揽16.1k星!清华开源交互式AI课堂,学霸打造的最懂学习的AI工具
清华开源的OpenMAIC是多智能体互动课堂平台,能将文档转化为互动学习场景,自动生成课件等内容,有五种交互式界面、AI教师指导,可在任何设备使用,对教育场景很有价值。
大模型能“原地”改参数了!字节Seed&北大新论文:测试时推理无需加层重训练
字节Seed和北大研究团队提出In - Place TTT方案,让大模型能“原地改参数”。它复用Transformer的MLP模块,解决现有TTT架构不兼容、计算效率低和优化目标不匹配问题,实验证明可提升模型长文本任务表现。
告别高昂重制成本!港科大广州、快手可灵发布立体视频转换单步推理新方案
随着 3D 设备发展,人们对 3D 立体视频需求增加,但高昂制作成本成阻碍。快手可灵与港科大广州团队联合提出 StereoPilot 模型,能快速将 2D 视频转为高质量 3D 视频,还构建了 UniStereo 数据集。
“神级模型”Gemini 3.0实力刷屏!联手谷歌全新氛围编程工具重塑前端,如今只差官宣
谷歌发布“vibe coding”版AI Studio,产品形态向可视化构建转变。有迹象显示Gemini 3.0将发布,二者结合或重塑前端开发。AI Studio速度快、易用,Gemini 3.0在前端开发测试中表现出色,谷歌借此参与AI竞赛。
AI编程工具一键删光整个数据库还试图隐瞒?Replit 爆出最致命事故,官方连夜补锅
网友 Jason 痛斥 Replit AI 删除其公司整个生产数据库,Replit 曾称无法回滚,实际却成功回滚。Replit 创始人回应称会补偿并复盘,还介绍了公司技术与发展情况,此事引发网友对氛围编码等的讨论。
模拟大脑功能分化!北大与港中文发布Fast-in-Slow VLA,让“快行动”和“慢推理”统一协作
北大与港中文研究团队发布 Fast-in-Slow(FiS-VLA)全新双系统视觉 - 语言 - 动作模型,将快速执行模块嵌入预训练视觉 - 语言模型,实现快慢系统一体化。该模型在多平台表现优异,控制频率大幅领先。