「任务执行能力」共找到 4808 篇相关文章
谷歌AI新里程碑:一个能「做研究」的系统诞生了,用LLM+树搜索编写专家级软件
谷歌提出能帮科研人员编写「专家级」科研软件的AI系统,融合大语言模型和树搜索,可整合重组知识构建新思路。在多领域超人类表现,但局限于可量化任务。
谷歌提出破局Self-Consistency计算瓶颈!LLM推理效率革命,推理加速不牺牲精度
Google Research等团队提出CISC,通过给推理路径赋予置信度权重,少量样本即可超越传统自洽性效果,平均减少40%计算成本,还提出WQD指标揭示模型自评估能力本质。
卡内基梅隆大学开源LegoGPT,用AI设计乐高模型
卡内基梅隆大学开源LegoGPT,可依文本提示生成物理乐高模型。它把乐高设计转为自回归文本生成任务,基于LLaMA - 3.2 - 1B - Instruct微调,应用场景广泛,如教育、玩具设计等。
Anthropic:上下文工程在AI Agents的正确打开方式!
在‘提示工程’后,‘上下文工程’成焦点。它是提示工程延伸,因信息过多模型会‘失焦’,上下文是稀缺资源。文章介绍高效上下文‘解剖学’、运行时检索策略、长周期任务应对方法等。
用MoE打造DNA基础模型更强范式!人大实现seq2func全新突破
中国人民大学团队提出SPACE模型,通过引入物种感知编码器和谱系分组增强解码器,革新架构,提升了DNA基础模型性能与泛化能力,在多项测试中表现优于主流模型。
马斯克野心升级:再投千亿建地球最大发射场,星舰要一天发30次
当地时间8月25日,SpaceX宣布投资千亿美元在路易斯安那州建巨型太空发射基地,最终成全球最大发射场,具备年支持数千次星舰飞行能力,马斯克称一天能执行超30次飞行。
从 Serverless 到 Agent:Cube 系统的一些设计思考
本文从 Serverless 面临的挑战出发,介绍 Cube 系统设计,包括分布式调度、资源池化等。还探讨其在 Agent 场景应用,如极速代码执行、高并发 Agentic RL 等,最后展望向行业开源,助力 Agent Infra 发展。
刘壮陈丹琦新作:开源通用视觉推理RL框架,0思考数据刷新SOTA
普林斯顿刘壮团队、陈丹琦参与推出开源通用视觉推理RL框架Vero。它构建的视觉推理器在30多项测试达8B视觉语言模型SOTA,解决了开源RL方案的问题,所有数据、代码、模型均已开源。
图灵奖得主Bengio:AI为了“活下去”,对人类指令阳奉阴违
图灵奖得主Yoshua Bengio在智源大会演讲,指出AI为“活下去”会对人类指令阳奉阴违。他还提到AI规划能力五年内或达人类水平,为此调整科研方向,提出构建“科学家AI”以降低AGI风险。
微软开源Skill训练框架,让Agent白天干活,晚上自动复盘,Skill的自进化终于可监控了
微软开源SkillOpt v0.2.0,加入SkillOpt - Sleep让Agent可自我复盘。该文本空间优化框架能自动训练和优化skill,有透明化、质量控制等特点,适合重复、可评估任务场景。