「低熵模型」共找到 8125 篇相关文章
刚刚,智谱正式成“全球大模型第一股”,开盘涨超3%!10位董事7个清华背景,专家:国内IPO抢收“确定性”,OpenAI们豪赌“无限性”
今天,智谱在港交所正式挂牌上市,成“全球大模型第一股”。其有技术、产品、商业化等竞争力,但未盈利,研发投入大。专家认为国内大模型厂商上市是抢收确定性,而OpenAI等是扩展无限性。
微软、哈佛开源创新优化器:全面超越Muon,提升大模型训练效率
随着大模型训练所需计算资源爆炸式增长,微软和哈佛团队联合开源优化器Dion。它利用低秩近似和解耦动量缓冲区,避免分布式训练同步完整梯度,在集中式和分布式场景都有高效表现,性能超Muon。
0.3B参数,600MB内存!腾讯混元实现产业级2Bit量化,端侧模型小如手机App
腾讯混元团队推出面向消费级硬件的“极小”模型HY-1.8B-2Bit,参数量仅0.3B,内存占用600MB。它基于产业级2Bit端侧量化方案,生成速度提升,还通过多种方法提升能力,未来将探索新技术缩小与全精度模型差距。
全员本科生!何恺明组新作:文生图,258M参数就够了
何恺明携本科生团队推出文生图模型MiniT2I,基于MM - JiT架构,仅用258M参数实现不错效果,训练成本低。该架构删繁就简,去掉VAE和AdaLN等模块,性能提升,展现出与工业级模型的竞争力。
CMU&斯坦福提出Reasoning新范式!自己找“窍门”,教会LLM抽象Reasoning
大型语言模型解决复杂推理问题时效率低,论文提出创新方法,让模型利用“推理抽象”,通过RLAD两玩家强化学习框架训练,在多基准测试提升性能,还分析了其作用、局限与未来方向。
超越ZIP的无损压缩来了!华盛顿大学让大模型成为无损文本压缩器
华盛顿大学SyFI实验室提出LLMc,利用大型语言模型进行无损文本压缩。基准测试显示其压缩率优于传统工具,且项目已开源。不过,当前版本存在效率、吞吐量等问题,应用范围也主要在自然语言。
里程碑!Artificial Analysis:Mac能跑的两款开源模型正式追上GPT-5
据Artificial Analysis报告,32B以下开源模型比肩GPT - 5。Qwen3.5 27B、Gemma 4 31B分别与GPT - 5中杯、小杯智能水平相当,虽知识全面性落后,但智能体表现和批判性推理进步大,硬件门槛低。
Token烧不起了?比肩Claude Opus 4.6免费模型来了,还将开源
昆仑万维旗下天工AI发布SkyClaw - v1.0,为Agent场景深度优化,免费试用后将开源,价格低。性能超同级别开源对手,逼近闭源巨头。训练围绕环境构建、数据合成、强化学习展开,适合长链路Agent工作流。
碾压DeepSeek V3!开源AI Agent专属模型,1万亿参数、工具使用能力超强
国内大模型平台月之暗面开源了模型Kimi - K2,这是混合专家模型,总参数1万亿。它针对AI Agent优化,工具使用能力强。测试显示其性能碾压DeepSeek V3等模型,训练流程还有独特技术创新。
DeepMind 最新研究:智能体就是世界模型!
DeepMind研究科学家Jon Richens团队在ICML 2025发表论文,从第一性原理证明智能体就是世界模型,回答了AI界多年的根本问题,还带来多个有趣推论,引发AI社区热烈讨论。