长任务跑分」共找到 2657 篇相关文章

算法论文7

The Batch: 881 | 一千万 token 的输入上下文

Google的Ali Behrouz等人设计“记忆模块”集成到类transformer架构ATLAS,能处理一千万token输入。它替代注意力层,训练后在上下文任务中表现佳,但小模型,大规模表现未知。

DeeplearningAI
新闻资讯8

GPT-5.2连肝7天,300万行代码造出Chrome级浏览器

Cursor的CEO让GPT - 5.2连续运行一周,产出300万行代码,从零构建Chrome级浏览器。还介绍不同模型任务表现、多智能体协作架构,指出这将颠覆软件开发经济学。

新智元
开源动态8

Meta开源Muse Glimmer,30B Agent小钢炮进你的电脑

Meta发布并以宽松协议开源Agent模型Muse Glimmer。它30B参数,能在Mac或PC上,多项Agent基准领先。可完成端到端任务、调用工具及多步推理,接受文本与图像交错输入,用途广泛。

AIGC开放社区
产品应用8

马斯克悄悄改了战场:Grok Build 0.2.60 剑指 Agent Runtime

2026年6月21日,Grok Build发布0.2.60版本更新,未推新模型能力,而是聚焦Runtime细节,针对会话难恢复、任务易卡住、工具输出易污染上下文等痛点优化,让Agent更稳定可靠。

AI科技评论
新闻资讯7

Karpathy戳破强化学习神话,首提AI复盘式进化!暴力试错将死

AI大神Karpathy发文指出强化学习(RL)有局限,效率随任务下降,与人类学习机制差异大。他提出复盘式进化Scaling范式,虽有很多细节待完善,但认为还有更多S型增曲线待发现。

新智元
算法论文8

大模型能“原地”改参数了!字节Seed&北大新论文:测试时推理无需加层重训练

字节Seed和北大研究团队提出In - Place TTT方案,让大模型能“原地改参数”。它复用Transformer的MLP模块,解决现有TTT架构不兼容、计算效率低和优化目标不匹配问题,实验证明可提升模型文本任务表现。

量子位
产品应用8

腾讯王者归来:混元图像3.0登顶LMArena!一手实测全球最强图像AI

LMArena最新榜单显示,腾讯「混元图像3.0」在文生图任务中夺冠,碾压谷歌Nano banana和字节Seedream 4。它9月28日开源,性能对标闭源模型,有强大推理、语义理解能力,支持中英文文本渲染。

新智元
开源动态8

世界模型有了开源基座Emu3.5!拿下多模态SOTA,性能超越Nano Banana

北京智源人工智能研究院的悟界·Emu3.5是最新最强的开源原生多模态世界模型,能处理图、文、视频任务,在多项权威基准上性能亮眼,还具备理解时序等能力,背后有技术创新,且选择开源。

量子位
新闻资讯8

智谱创始人唐杰透露:原生多模态模型将在数月内上线

智谱创始人唐杰透露原生多模态模型数月内上线。智谱上市后股价涨幅大,但多模态是短板。唐杰还判断今年AI最可能在时程任务突破,阐述技术支柱、自我进化等观点,称将重塑各行业。

AI前线
新闻资讯8

Anthropic 发布 AI Agent 上下文工程指南

今年6月Andrej Karpathy提出用「上下文工程」取代「提示词工程」。Anthropic发布工程博客呼应此观点,指出构建AI应用重心转向策划上下文。文章详述上下文工程重要性、有效上下文剖析、检索及任务应对技术等。

AGI Hunt