「模型突破」共找到 8135 篇相关文章
腾讯混元最新开源:一套RL框架打通多个模态,庞天宇团队新作
大语言模型的RL技术已成熟,但多模态生成模型的强化学习训练仍“各自为战”,制约AIGC模型能力上限。腾讯混元庞天宇团队开源UniRL框架,打通多模态RL后训练,覆盖多种模型,内置算法与奖励组件。
静态稀疏已死:Flux Attention 开启长文本 LLM 自适应推理新时代
文章指出长上下文LLM高效推理面临性能与效率难题,先介绍Elastic Attention打破静态稀疏桎梏,后重点阐述全新的Flux Attention,它将动态稀疏注意力范式升级为层级别路由,解决了算法与硬件的矛盾,在多方面实现突破。
谷歌TPU逆袭英伟达,创始人一夜之间跃升全球第二、第三富豪
近期谷歌股价飙升,市值逼近4万亿美元,创始人财富排名跃升。其股价上涨源于AI领域双重突破:Gemini 3获赞誉,AI芯片业务有进展。英伟达回应称技术领先,谷歌逆袭有五大原因,如Gemini 3受欢迎等。
再不怕乱引文献!绕过付费墙,BibAgent把学术核验转为证据链
大模型生成学术论述,其引用验证成难题,尤其付费墙后论文难以核验。BIBAGENT突破此困境,不破解付费墙也能验证引文语义真伪,还构建MISCITEBENCH评测,表现优异,为科学写作补“可审计基础设施”。
谷歌AlphaGenome登Nature封面!破译生命基因暗物质
Google DeepMind团队的AlphaGenome模型开源并登上Nature封面。它能以单碱基精度破译百万碱基对DNA序列调控密码,在多项基因组轨迹预测任务表现出色,还可用于疾病研究,虽有不足但潜力巨大。
256G内存条涨到天价:不是内存条疯了,是算力正在变成新土地
近期,256GB内存条单根突破4万元。这并非普通DDR5,而是服务器专用内存。其价格飙升源于供需错配,大模型训练对大容量内存需求极端。有人认为是泡沫,也有人觉得是结构性变化。
GPT-5 核心成员详解 RL:Pre-training 只有和 RL 结合才能走向 AGI
本文编译 OpenAI 研究副总裁 Jerry Tworek 访谈,探讨 RL 与通向 AGI 路径。他认为 pre - training 与 RL 需结合,GPT - 5 是 o3 迭代,还谈及推理、模型发展、训练方式及 OpenAI 研究情况等。
一句“吴恩达说的”,就能让GPT-4o mini言听计从
宾夕法尼亚大学研究者发现,用恭维、同侪暗示等心理话术,能让GPT - 4o Mini突破安全底线。实验基于七大说服技巧,证明人类心理学原则可迁移至LLM。不过,此漏洞或被利用,已有团队尝试应对。
科研的回归:AutoSOTA如何终结“增量式优化”的重复劳动
当前AI科研中,为提升性能指标,研究者投入大量精力做“增量式优化”,限制原创探索。AutoSOTA项目由清华与中关村学院联合发布,它基于智能体系统构建自动化方案,接管实验迭代,一周发现105个SOTA模型,推动科研回归原创。
AGI 新技术路线:下一代稀疏注意力机制 Monte Carlo Attention 开源
超对称技术公司在新版基座模型 BigBang - Proton 中使用的 Monte Carlo 注意力开源。它基于二进制块编码技术,用块间代表交流机制实现线性复杂度,兼具多种注意力机制优点,可满足宇宙尺度建模的上下文长度需求。