长序列训练」共找到 2701 篇相关文章

推荐文章8

翁荔最新博文深度拆解Scaling Laws:AI行业最信赖的公式,没有那么可靠

6月24日,前OpenAI安全研究副总裁翁荔在博客发表文,对缩放定律进行系统梳理,指出该理论在实际拟合和外推过程有易被忽视的陷阱,还讨论了数据有限时定律是否成立等问题。

DeepTech深科技
产品应用8

编程新王Composer 2.5来了,逼近Opus 4.7!成本仅为1/10

Cursor推出全新AI编程模型Composer 2.5,在部分编程基准测试上接近Claude 4.7 Opus和GPT - 5.5,运行效率最高提升10倍,成本仅为竞品一小部分。其采用定向文本反馈RL等机制,还与SpaceXAI合作冲击百万H100集群算力。

新智元
算法论文8

WWW'26 | 跨任务自适应的Multi-Agent协作新范式

大型语言模型驱动的多智能体系统成解决复杂任务重要范式,但智能体协作存在关键问题。Griffith和西北农林科技大学团队提出OFA - MAS,将多智能体拓扑设计从one - for - one推向one - for - all,实验效果佳。

PaperAgent
算法论文7

Transformer与RNN合体,谷歌打下显存门槛,解锁超上下文

谷歌论文提出 Memory Caching 技术,通过架构机制创新赋予 RNN「可生的记忆容量」,兼顾 Transformer 与 RNN 优势,能处理更文本、降低推理资源门槛,实验显示有良好效果。

机器之心
开源动态8

字节最火的开源Agent项目,如何思考Agent的自我进化?

4月5日,LangChain创始人Harrison Chase阐述对Agent自我进化的思考,认为Agent系统可在Model、Harness、Context三层持续进化。知名开源框架DeerFlow联合作者Daniel也补充了团队思考。

Founder Park
新闻资讯8

Meta 143亿挖角后的首个作品:Alexandr Wang 推出闭源模型,杨立坤点赞

沉寂9个月后,Alexandr Wang带队的Meta发布新一代模型Muse Spark。它是原生多模态推理模型,性能媲美Gemini Pro和GPT 5.4,在多领域有应用潜力。不过闭源引争议,且在部分领域有短板。

InfoQ
推荐文章8

硬核拆解 Hermes-Agent:自学习 Skill 机制的架构设计与实现原理。

文章围绕Hermes - Agent展开,指出多数Agent缺乏自学习能力,而它试图跨越这一鸿沟,能自动“写手册”(Skill)。介绍其架构、安装配置,通过代码审计任务演示自学习过程,并解析Skill机制,为生产级Agent提供新思路。

AI大模型应用实践
算法论文8

西湖大学张驰团队:从视觉合成到空间理解,视频 AI 正在「转向」丨CVPR 2026

过去两年视频生成发展近成熟,但多数模型缺乏空间结构稳定建模能力。西湖大学AGI Lab团队提出论文,将问题落回推理阶段,让相机轨迹成约束条件,推进视频生成到三维结构约束建模。

AI科技评论
开源动态8

最强开源搜索再升级,研究、预测能力实测超惊艳!

MiroMind团队发布新一代模型MiroThinker-1.7和MiroThinker-H1,定位为重型推理智能体。其研究能力强、推理可靠,还能生成网页报告。新版本升级显著,靠两项关键技术实现有效交互,且预测案例表现出色。

开源先锋
产品应用8

Claude 这个更新,让模型能力提升10%+!

Claude开放100万上下文度更新,实际可用空间接近8倍提升。数据显示,上下文越Claude与其他模型差距越大。API取消溢价,还更新图片/PDF上限、将Adaptive Thinking转正式版。

花叔