端到端可微分」共找到 2303 篇相关文章

算法论文8

韩松等提出FlashMoBA,比MoBA快7.4倍,序列扩512K也不会溢出

今年2月月之暗面提出MoBA,在处理长上下文有潜力,但业界缺乏对其性能设计原则的理解和高效GPU实现。来自MIT、NVIDIA的研究者提出FlashMoBA,解决了小块MoBA性能挑战,实验显示其在多方面表现优。

机器之心
推荐文章7

8种LLM架构设计大比拼:从 DeepSeek-V3 Kimi K2,究竟有啥不同

文章对比了8种LLM架构设计,如DeepSeek-V3、OLMo 2等。介绍各模型关键技术,像DeepSeek-V3的多头潜在注意力和混合专家架构,还分析不同设计对性能、效率的影响,助读者了解LLM架构差异。

CourseAI
产品应用8

小说一键转有声剧!豆包语音团队提出「AI多人有声剧」方案,沉浸感拉满了

豆包语音团队发布「AI 多人有声剧」自动化方案,基于多角色 Seed - TTS - 2.0 模型,实现从小说文本有声剧成品 AI 制作,成本和周期大降,首批有声剧已在番茄小说 App 上线。

机器之心
开源动态8

刚刚,新版DeepSeek-R1正式开源!直逼o3编程强离谱,一手实测来了

临近午假期,新版DeepSeek - R1凌晨正式开源,模型权重已上传HuggingFace。其性能几乎与o4 - mini(Medium)相当,编程实测超越Claude 4 Sonnet。有多项更新亮点,经实测性能获“史诗级”加强。

新智元
产品应用8

颠覆法律行业!Anthropic一口气发布20+款MCP连接器,从合同审查法庭诉讼全覆盖

Anthropic面向法律行业推出超20款新MCP连接器及12个专业插件,从底层打通法律技术栈。Claude可在办公软件中工作,覆盖合同审查法庭诉讼等场景,还与多机构合作让法律服务更普及。

AI寒武纪
开源动态8

智谱终于发布GLM-4.5技术报告,从预训练后训练,细节大公开

上个月底智谱开源 GLM-4.5 及轻量版,成绩亮眼引热议。现其技术报告发布,详述预训练后训练细节,还介绍了开源 RL 框架 slime,展示模型架构、训练阶段等,评估了在多任务上的表现。

机器之心
开源动态7

还在复制粘贴提示词?Memory+Checkpointing 让你从"每次重头来""迭代越来越快"

文章介绍了Claude Code最佳实践地图,它将零散手动探索工程化,把关键模块整理成可导航路线图。核心功能包括三段编排、Subagents、Memory + Checkpointing,还给出不同场景方案及使用方法。

小华同学ai
产品应用8

AI体育教练来了!中国团队打造SportsGPT,完成从数值评估专业指导的智能转身

现有智能体育系统多停于‘打分+可视化’,通用大模型处理体育生物力学分析有局限。中国团队提出SportsGPT框架,实现从‘动作评估’‘训练处方’智能闭环,各模块优势明显,超越基线。

量子位
算法论文8

ACL 2026 综述:从事后解释内生解释,大模型内生可解释性的前沿进展

大语言模型强大但解释性成问题,过去多事后解释,现更多研究者转向内生可解释性。ACL 2026 接收的综述论文梳理相关代表方法,总结为五类核心设计范式,指出该方向面临挑战但趋势清晰。

机器之心
产品应用7

陪5岁小朋友玩黔驴技穷,我用一张照片给他做了个汪汪队手办。

作者陪5岁小朋友玩时,用一张照片结合Hi3D网页和3D打印技术做汪汪队手办。介绍了3D建模、格式选择、代加工等全流程,还分享了成本控制和上色等经验。

探索AGI