「视觉-语言-行动模型」共找到 1727 篇相关文章
Claude Opus 4.7突然发布:逐字级精准执行指令,软件工程和视觉能力大幅领先opus 4.6
Anthropic突然发布Claude Opus 4.7,重点提升软件工程能力,视觉能力也大幅跃升。指令遵循能力实质性提升,记忆能力改善。还同步上线新功能,升级前需关注分词器和token输出变化。
TypeScript 之父 Anders Hejlsberg:别折腾“AI新语言”了,真正变天是 IDE 让位给 Agent
TypeScript 之父 Anders Hejlsberg 在与 GitHub 研究顾问对谈中回应质疑,称选 Go 重写编译器合理。他认为 AI 编程时代,TypeScript 语言服务将重塑,IDE 或让位给 Agent,还谈到 AI 在代码迁移中的应用及开源可持续性问题。
Unsloth宣布更新,可免费用强化学习训练视觉大模型Qwen2.5-VL-7B
Unsloth宣布更新,支持视觉/多模态模型强化学习训练,含Gemma 3和Qwen2.5 - VL。其独特机制使VLM RL训练速度提升、显存占用降90%等。还引入GSPO算法,能在免费Colab T4 GPU训练Qwen2.5 - VL - 7B。
复旦、同济和港中文等重磅发布:强化学习在大语言模型全周期的全面综述
来自多所顶尖科研机构的研究者完成长文综述,总结大语言模型全生命周期的强化学习研究,阐述其各阶段应用策略,分析未来挑战与趋势,重点关注 RLVR 技术,有全生命周期梳理等三大贡献。
MiniMax开源首个视觉RL统一框架,闫俊杰领衔!推理感知两手抓,性能横扫MEGA-Bench
MiniMax开源首个视觉RL统一框架V-Triune,由闫俊杰领衔。该框架通过三层组件设计和动态IoU奖励机制,让VLM能联合学习推理和感知任务。还开发Orsta模型系列,在MEGA - Bench表现出色,且MiniMax多模态布局动作多。
机器人是具身大模型的「用户」:超维动力如何打通从人类经验到机器人行动?
今年WAIC,超维动力展台的乒乓球桌和双臂机器人开易拉罐演示吸引关注。其机器人90%经验来自人类第一视角数据,超维动力全栈布局,试图打通人类经验到机器人行动链路,目标是建立机器人持续进化方式。
AI教父辛顿上海WAIC主题演讲:LLM真的理解语言,数字智能极其危险,可以无限复制
AI教父杰弗里·辛顿在WAIC开幕式演讲,对AI发展警惕且悲观。他认为LLM真理解语言,数字智能与生物智能差异大,AI进化快很危险,人类应全球合作研究让AI向善。
李飞飞终于把空间智能讲明白了:AI 的极限不是语言,世界远比文字更广阔!
李飞飞在人工智能聚焦语言模型时关注空间智能。她指出当前AI局限,亲自撰文阐述构想。构建具空间智能的世界模型挑战大,但应用潜力大,如创意、机器人、科研医疗教育等领域,能赋能人类。
更大,还能更快,更准!蚂蚁开源万亿参数语言模型Ling-1T,刷新多项SOTA
10月9日,蚂蚁开源万亿参数语言模型Ling-1T。它延续自研高效MoE架构,在编程、数学推理等多维度测试表现亮眼,还能兼顾精确与效率。此外,它在多场景实用性强,其创新设计提升了能效比与性能。
带图推理碾压同类开源模型!港中文微软等开源OpenThinkIMG框架,教AI学会使用视觉工具
港中文、微软等联合推出OpenThinkIMG开源框架,解决AI使用视觉工具面临的集成难、缺数据、适应差等问题,还公开核心技术V - ToolRL。该框架在图表推理任务上表现超GPT - 4.1,为下一代AI智能体提供基础。