全注意力机制」共找到 2720 篇相关文章

开源动态8

7.5K Star!HKUDS开源AI栈开发框架,产品经理的Demo神器!

AI时代从论文到产品Demo开发链路工作耗时费力,现有Agent也有诸多问题。香港大学数据科学实验室(HKUDS)开发的DeepCode开源框架,定位“自动AI软件开发框架”,可一键从论文/需求生成完整项目,已获7.5K Star。

开源星探
产品应用8

颠覆法律行业!Anthropic一口气发布20+款MCP连接器,从合同审查到法庭诉讼覆盖

Anthropic面向法律行业推出超20款新MCP连接器及12个专业插件,从底层打通法律技术栈。Claude可在办公软件中工作,覆盖合同审查到法庭诉讼等场景,还与多机构合作让法律服务更普及。

AI寒武纪
开源动态8

抖音SAIL团队联合港中文MMLab推出SAIL-Embedding:打通「视、文、音」的模态嵌入

字节跳动抖音SAIL团队联合港中文MMLab提出SAIL - Embedding,专为大规模推荐场景设计,实现视、文、音统一表征,解决传统多模态模型局限,在抖音业务场景效果显著,相关技术报告已公开。

机器之心
产品应用7

我如何用低代码平台复刻NotebookLM体验:从文档到可控PPT生成,流程实战。

本文作者用低代码平台BISHENG复刻NotebookLM的PPT生成功能。介绍了技术栈,详述工作流搭建,包括文档上传、问答、PPT生成等,还提及HITL机制提升成功率,最后总结了低代码平台的优势与不足。

AI大模型应用实践
开源动态8

北大字节开源首个时空推理视频模型!思考过程透明,性能超越GPT-4o

北大和字节联合团队推出开源模型Open-o3 Video,将显式时空证据嵌入视频推理过程,采用non-agent架构,性能超越GPT - 4o等闭源模型。该模型构建了STGR语料体系,采用双阶段训练,实验表现优秀。

量子位
算法论文8

为什么BF16的FlashAttention会把训练「炸掉」?清华首次给出机制解释,用极简改动稳住训练

社区里长期存在的FlashAttention+BF16训练GPT - 2时loss突然爆炸的问题,清华团队论文给出机制解释。指出是特定条件下数值偏置被放大所致,还给出极小修改稳定训练,且在多模型和硬件上验证有效。

机器之心
新闻资讯8

同一天,百度、OpenAI双双发力高智能AI!先来实测一波原生模态文心5.0

2025年,OpenAI凌晨更新GPT - 5系列,百度在世界大会发布文心5.0。它采用原生模态统一建模技术,参数达2.4万亿,评测领先。实测表现佳,其技术在多方面突破,为大模型演进提供路径,助百度重回竞争中心。

机器之心
产品应用8

谷歌Veo 3魔性切水果刷屏网!逼真视频狂吸10万粉,体网友颅内高潮

谷歌AI视频工具Veo 3生成的解压切水果视频在网病毒式传播,TikTok号主粉丝量猛涨。今天凌晨谷歌官宣其正式上线,网友热情高涨。此外,它还能实现多种创意视频生成,一位制作人用它两天做出3000万播放量广告。

新智元
产品应用8

腾讯AngelSlim重磅升级!面向模态的大模型压缩算法工具包,推理速度飙升 1.8倍!

近年来,推理阶段的成本等因素制约大模型规模化应用。腾讯混元升级的 AngelSlim 围绕 Eagle3 投机采样训练范式构建系统化实现,支持多模态场景,最高可实现 1.9× 推理加速,还具备多亮点。

腾讯技术工程
产品应用8

每2秒吃透一道高数大题!华为终于揭秘准万亿MoE昇腾训练系统流程

华为揭秘准万亿MoE昇腾训练系统流程,通过“昇腾+Pangu Ultra MoE”实现国产算力与模型自主可控训练闭环,从集群利用率、单节点算力、后训练技术三方面突破,实现大模型高效训练。

量子位