「E-LLM-Stack」共找到 1027 篇相关文章
别问树模型了!死磕结构化数据,清华团队把大模型表格理解推到极限
AI 时代处理结构化数据成痛点,LLM 大模型难以满足生产要求。清华大学与稳准智能联合发布的 LimiX 系列模型,做到真正通用,在跑分和实际落地表现出色,其轻量级版本 LimiX - 2M 适合边缘设备和科研场景。
微信、清华连续自回归模型CALM,新范式实现从「离散词元」到「连续向量」转变
腾讯微信 AI 联合清华提出连续自回归语言模型 CALM,它将语言建模为连续向量而非离散词元,显著改善性能与计算成本权衡,解决了 LLM 效率瓶颈,虽面临技术挑战但实验效果佳,还指明未来研究方向。
斯坦福大模型推理课免费了,谷歌推理团队创始人主讲
谷歌DeepMind推理负责人Denny Zhou在斯坦福大学CS25讲“LLM推理”课。大模型推理是给出答案前的中间思考步骤,能让复杂问题可解、提升答案准确性。还介绍了让模型输出推理答案的方法及提升推理能力要点。
Multi-Agent记忆系统MIRIX:比RAG性能飙升35%,存储减少99.9%
现有AI Agent记忆方案有局限,MIRIX作为模块化多智能体记忆系统应运而生。它由六种记忆类型和多智能体框架组成,支持多种检索功能。在多模态和单模态测试中表现优异,为记忆增强型LLM智能体设新标准。
ROLL:面向大规模语言模型的高效强化学习框架
本文介绍阿里推出的ROLL强化学习框架,专为LLM训练优化。它设计灵活,不同用户可用其满足业务、探索或线上指标需求。在多任务训练中性能出色,还采用创新机制提升效率,支持自定义操作,适合学术和业务场景。
4秒出百万面!突破千万面精度+12K高清贴图,手握数亿的3D生成公司下一局怎么打?
影眸科技旗下Hyper3D受英伟达青睐。该司完成数亿元融资,发布全新模型Hyper3D Rodin Gen - 2.5,引入类LLM的Thinking机制,4秒生成百万面级模型,还突破千万面精度,搭配12K原生3D贴图模型。
实测!DeepSeek V4-pro是第一个接近Claude开源模型,前Meta研究员震惊
DAIR.AI创始人、前Meta AI研究员Elvis用DeepSeek - V4 - Pro在Pi框架搭LLM知识库,该模型开箱即用,完成知识密集型多步研究任务表现出色,在开源模型里Agent编程和推理能力强,架构设计让推理快且成本低。
老黄亲自打钱!马斯克一夜狂融1400亿,百万GPU豪赌AGI终局
马斯克的xAI获200亿美元E轮融资,英伟达等参投。xAI估值逼近OpenAI,手握超百万GPU,Grok 5在训。马斯克称2026年AGI降临,AI将冲击就业,xAI有望成谷歌对手,不过Grok也陷入‘脱衣’风波。
刚刚!Kimi Linear横空出世,全新注意力架构:1M长文本解码速度飙升6.3倍,KV缓存砍掉75%
月之暗面推出全新注意力架构Kimi Linear,有望成下一代Agent LLM基石技术。它解决了LLMs处理长序列任务的瓶颈,性能超传统机制,还开源了核心代码。Kimi Linear的KDA模块提升了表达和硬件效率,实验表现佳。
RL后训练步入超节点时代!华为黑科技榨干算力,一张卡干俩活
在大模型竞赛白热化当下,强化学习后训练成突破LLM性能天花板核心路径,但算力浪费和集群效率低是难题。华为团队祭出两大黑科技破局,在超节点实现训推共卡,资源利用率翻倍,还提升训练速度。