「离散扩散架构」共找到 2061 篇相关文章
Claude Opus 4.5 × Agent Skills:从第一性原理深入剖析
文章深入剖析Claude Opus 4.5与Agent Skills,介绍了Claude Opus 4.5发布,结合Agent Skills能让模型有专业级能力。还阐述Agent Skills高级设计模式、内部架构及执行生命周期,揭示其工作机制与优势。
别再问什么工作被AI取代!Karpathy直指本质:你的工作「可验证」吗?
前特斯拉AI负责人Andrej Karpathy提出,软件1.0自动化能指定的任务,软件2.0自动化能验证的任务。判断任务能否被AI接管,关键看是否满足可重置、可高效试错、可自动奖励三条准则。
长上下文快2.9倍,解码快6倍:Kimi 用线性注意力实现性能与效率双突破
月之暗面团队的Kimi Linear模型,是混合线性注意力架构,核心是Kimi Delta Attention模块。它解决线性注意力的记忆及遗忘问题,在多任务测试表现出色,还开源相关资源,推动高效长上下文模型研究。
Mamba-3惊现AI顶会ICLR 2026!CMU知名华人教授一作首代工作AI圈爆红
Transformer有力挑战者Mamba的最新版本Mamba-3进入ICLR 2026盲审。它有三大改进,在长文本处理、实时推理和成本优化有优势。此外,FBAM也从不同角度探索Transformer下一代框架。
又一款国产高性能GPU问世,实力对标海外巨头
2025年9月22日,芯动科技发布“风华3号”全功能GPU,它架构全面,功能覆盖广,在大模型等领域有多个突破,还适配多生态与系统。该产品能为多行业定制服务,标志国产GPU进入规模化应用阶段。
时隔多年,AI芯片又是华为发布会主角了
华为全联接大会上,轮值董事长徐直军带来全球最强算力超节点和集群。公布昇腾、鲲鹏芯片未来2年演进规划,还开创灵衢互联协议。虽单芯片受限,但集群层面有望实现超越。
DeepDiver-V2来了,华为最新开源原生多智能体系统,“团战”深度研究效果惊人
华为发布DeepDiver-V2原生多智能体系统,采用“团队作战”模式,在复杂知识问答和长文报告生成上表现出色。它以Planner为中心协调多个Executor,有智能任务分解等优势,训练也有新机制,昇腾NPU集群加速。
任意骨骼系统的模型都能驱动?AnimaX提出基于世界模型的3D动画生成新范式
传统3D动画制作依赖骨骼绑定与关键帧编辑,成本高。现有自动化方法有局限。北京航空航天大学团队提出AnimaX框架,结合视频扩散模型与骨骼动画优势,支持任意骨骼拓扑,生成动画质量高、速度快,泛化能力强。
智谱开源GLM-4.5工具调用超越Claude Opus 4.1,成本仅1.4%
开源模型GLM-4.5在伯克利工具使用榜单上超越Claude Opus 4.1,运行相同任务成本仅为1.4%。它采用MoE架构,在多场景表现卓越,推理速度快,成本低,还接入多款主流编程工具。
腾讯开源WMT2025冠军大模型:拿下30个第一,同类最佳
昨晚腾讯开源WMT2025冠军翻译大模型Hunyuan - MT - 7B,它在31种语言测试中获30个第一,成同类最佳。文中介绍其架构、训练过程,还通过多场景翻译案例展现优势,有望推动高质量翻译普及。