文本频率定律」共找到 566 篇相关文章

开源动态8

基于闪电注意力机制,创新高效开源大模型

传统Transformer架构处理长文本和复杂推理任务有效率瓶颈,多数领先模型仍依赖传统注意力设计。MiniMax开源基于闪电注意力机制的专家混合模型Minimax,从架构、创新模块、训练框架等多方面优化,表现突出。

AIGC开放社区
算法论文8

盘一盘,2017年Transformer之后,LLM领域的重要论文

本文梳理2017年Transformer后LLM领域重要论文。如提出Transformer架构的论文成现代AI基石;介绍GPT - 3的论文确立‘大模型 + 大数据’缩放定律,引领LLM军备竞赛等。还列举各论文内容与影响。

机器之心
产品应用7

蚂蚁多模态统一框架Ming-Omni:能看懂世界、会说话、还能画画

文章介绍蚂蚁多模态统一框架Ming - Omni,它可统一处理图像、文本等多模态数据。该框架解决了多模态训练中模态表示差异、收敛速度不一致等问题,采用分阶段预训练,能用于图像、音频生成及多模态交互。

CourseAI
算法论文7

“看懂”指令并做动作!Motion-R1结合COT让角色动起来

大语言模型为文本驱动动作生成带来新可能,但现有方法有局限。GigaAI提出Motion - R1框架,融合“思维链”机制,能分解指令、优化动作合成,虽有不足,但在测试中表现优于主流方法。

带你学AI
开源动态8

开源2天斩获3K标星!开源TTS新星Chatterbox盲测击败ElevenLabs!

文本转语音(TTS)技术发展快,但达顶尖水平仍有挑战。开源TTS新星Chatterbox,开源2天冲上GitHub热榜,星标超3K。它功能亮点多,安装简单,适用于多种场景,性能超ElevenLabs。

开源星探
开源动态7

DeepSeek R1 迎来小更新大升级,性能直逼 OpenAI o3!

昨日,DeepSeek 发布 R1 大模型最新版本 DeepSeek - R1 - 0528 并开启公测。虽官方未附详细技术说明,但用户反馈推理和输出有改进,也有性能方面的不同看法,其在基准测试表现佳。

AI科技大本营
开源动态8

15个前沿大模型,100个职业场景:谁才是最强AI打工人?

通义千问与港中文联合发布OccuBench,用语言世界模型评测AI Agent职业能力。评测15个前沿模型,发现无全能选手,隐式故障难处理,Scaling定律有效,做Agent和环境模拟器能力不同,还给出具体案例。

AI科技评论
推荐文章7

LightX2V Ulysses Attention 实现学习笔记

本文记录了LightX2V中Ulysses Attention的实现方式与张量形状推导。在多模态/视频场景,其实现可概括为一种layout变换,还提供`enable_head_parallel`和`use_fp8_comm`选项,效果受运行环境等因素影响。

GiantPandaLLM
算法论文8

【梁文锋署名】DeepSeek再发新论文:75%思考+25%记忆,这是他们算出来的最优解

DeepSeek新论文《Conditional Memory via Scalable Lookup》提出Engram模块,指出大模型用计算模拟查字典是浪费算力,Engram能给模型装“记忆”,还发现参数分配呈U型缩放定律,推理和长上下文能力提升显著。

花叔
新闻资讯7

利用Loop语言模型扩展隐式推理 | 直播预约

当前大语言模型依赖显式文本生成推理,未充分利用预训练数据。将介绍最新工作Ouro,Loop语言模型家族,核心创新多,虽参数少却性能优,还会讨论其推理轨迹及模型Scaling新可能。

深度学习自然语言处理