「复杂任务」共找到 2517 篇相关文章
Claude Code 网页版曝光, 留给 Lovable 和 Manus 们的机会,可能,不多了
网友发现Claude Code网页版选项,虽被Anthropic撤回,但功能已曝光。它有三种安全级别,处于研究预览阶段,界面功能完整,欲打造云原生开发平台,或改变编程方式,也让竞品压力增大。
科幻!谷歌放出Gemini Robotics-ER 1.5:机器人有了真正的思考力
谷歌推出首个广泛开放给开发者的机器人具身推理模型Gemini Robotics - ER 1.5,可作为机器人高级推理大脑。它能解决物理问题,有新能力如快速空间推理等,还能让开发者平衡延迟与准确性。
三大核心创新公开,快手开源多模态Keye-VL 1.5拿下视频理解SOTA,8B力压GPT-4o!
快手开源多模态Keye-VL 1.5,为8B视频理解最强模型,公开3大核心创新技术。它靠Slow-Fast视频编码等,在20+基准屠榜。在多类基准测试和内部测评中表现优异,将业务经验沉淀到开源社区。
快慢Reasoning综述!
大型语言模型在复杂推理任务中有‘无差别计算’缺陷,阻碍其在多场景应用。本文提出双层效率优化框架,梳理两类前沿技术,通过实验揭示瓶颈,为轻量化推理指明路径。
Kimi新模型拿下代码开源SOTA,仅仅72B,发布即开源
深夜,Kimi发布新开源代码模型Kimi - Dev,在SWE - bench Verified上以60.4%成绩获开源SOTA。参数量72B,编程水平强。采用MIT协议,权重和代码已发布。官方透露了部分关键技术,更多细节待后续报告。
微软:LLM上下文学习并非真的学习!
微软研究指出大模型上下文学习(ICL)虽数学上符合学习定义,但只是拟合prompt内统计规律,非掌握任务本质。通过大量实验,得出如例子越多模型表现越好、语言不重要统计重要等7条关键发现。
超长推理还能节省计算!Salesforce开源神器两连发:教大模型边想边省,显著提升数学编程准确率
Salesforce AI Research开源Elastic Reasoning和Fractured Sampling。前者将推理流程分两部分,分配token预算,使输出缩短、准确性提高;后者打碎推理链条,从三维度采样,以更少tokens换更高准确率,均提升数学和编程任务准确率。
AI玩拼图游戏暴涨视觉理解力,告别文本中心训练,无需标注的多模态大模型后训练范式
在多模态大模型后训练浪潮中,现有方法多以文本为中心。MMLab@南洋理工大学提出Visual Jigsaw,将拼图任务用于后训练,让模型不依赖标注强化视觉感知与理解,在图片、视频和3D模态验证有效。
我用MiniMax Agent开发了个带后端的全栈网站,全程0代码
2025年Agent成AI领域焦点,大厂纷纷布局。作者测试MiniMax Agent,发现其有四大特点:深度研究和上下文管理强,多模态输出出色,编程能力超预期,能执行定时任务,还能开发带后端的全栈网站。
Google研究发现:Multi-Agent的核心竟然是Prompt设计!
Google和剑桥大学研究多智能体系统,发现提示设计影响大,有效拓扑结构占比小。提出Mass框架分三阶段优化,实验用Gemini 1.5 Pro和Flash模型,对比多种方法,在多任务上性能显著提升。