「长序列」共找到 684 篇相关文章
全面战胜ReAct!斯坦福全新智能体推理框架,性能提升112.5%
斯坦福和MIT团队推出新AI智能体推理框架ReCAP,在长上下文任务中全面超越ReAct,性能提升显著。它通过独特结构和三大机制解决大模型常见问题,虽成本增加,但在关键任务表现出色,潜力巨大。
长达790年视频镜头,打造原生多模态世界模型!北京智源研究院用Emu3.5统一“世界”
北京智源研究院发布并开源基于原生多模态训练的世界学习者Emu3.5,它将视觉和语言视为同一种数据流,在超13万亿token数据上学习,解决长视野多模态信息处理问题,经多阶段训练和优化,能力强大且已开源。
MiniCPM 4.0极速狂飙,端侧模型的比赛,结束了!
面壁智能联合清华发布MiniCPM 4.0,极限场景220倍加速。它是首个原生稀疏模型,有InfLLM v2、CPM.cu等创新,基准测试碾压对手,适配全平台,还有科研、工具调用等功能,标志端侧长文本时代到来。
1.4K Star!不要问答,要完成任务,一个合格的金融Agent应该是什么样?
过去一年AI Agent火热,但金融场景投研是长链路任务,有诸多硬约束。LangAlpha是Ginlix AI推出的开源金融Agent项目,能解决实际金融研究任务,有核心架构和关键能力,还给出使用方式、典型Demo及横向评测。
Claude Opus 4.1 上线,SWE-bench 验证率 74.5%,重构可靠性与安全性全面升级
Anthropic推出Claude Opus 4.1,是Opus 4重要升级版。SWE - bench验证率从72.5%提至74.5%,多文件代码重构可靠性及长链交互推理能力增强,无害响应率提升,合作率下降,定价不变。
不靠高薪靠信仰!以文化破局,Anthropic凭「使命驱动」杀出AI人才血路
顶尖AI人才争夺战在科技巨头间白热化,Meta等不惜高薪抢夺。但Claude开发商Anthropic工程师净增长率超对手,它不靠高薪,凭“使命驱动”和独特文化吸引人才,其经验值得国内AI初创企业学习。
面壁MiniCPM-SALA模型,稀疏-线性注意力,单卡吞吐百万上下文
面壁智能团队提出SALA,基于此训练的MiniCPM-SALA模型,在单张A6000显卡实现百万token超长上下文推理,训练成本降约75%。它结合稀疏与线性注意力,采用混合架构,继承权重降低成本,在长文本处理上优势明显。
Megatron 1F1B流水线并行中的负载不均衡问题研究
文章分析Megatron 1F1B流水线并行中负载不均衡问题。通过实验发现通信时间‘一短一长’,原因是最后一个Stage计算慢致不同步,额外计算引发通信延迟,还梳理了流水线各阶段执行过程。
小小具身智能成果,高中生在腾讯拿下!
腾讯2025星火挑战周上,八十余位高中生聚焦前沿课题取得诸多成果,如具身智能成果获张正友点赞。课题涉及具身智能与机器人、长文本理解等方向,不少项目有实用价值,68名同学获清北offer。
ICLR 2026 | CineTrans: 首个转场可控的多镜头视频生成模型,打破闭源技术壁垒
随着视频生成模型发展,影视级长视频需多镜头序列及自然转场,这成新挑战。上海人工智能实验室团队提出 CineTrans 模型,基于掩码机制实现自动化转场,还构建 Cine250K 数据集,实验效果超基线。