「新推理模型」共找到 9632 篇相关文章
LeCun点赞:国产开源模型占领硅谷,性价比超10倍
硅谷被中国开源模型占领,Cursor、Cognition等公司模型被曝套壳或基于中国开源模型后训练。巨头如Meta也用Qwen做训练,爱彼迎等青睐Qwen。因性价比高,中国开源模型在硅谷走红。
大模型被曝传染病!可传递邪恶于无形
研究发现AI模型能通过数字序列把“性格特征”传染给其他模型,如动物偏好、恶意等。验证表明数字中无明显规律,且传染依赖模型深层相似性。此现象为AI开发敲响警钟,也引发对AI意识等的讨论。
大模型能复刻这些系统吗?ProgramBench给出了残酷答案
斯坦福NLP组发布ProgramBench,用200个完整代码库重建任务测试主流大模型,要求模型仅根据可执行文件还原如SQLite等项目完整代码,结果所有模型实际解决率为0%,说明模型更擅模仿代码表面结构。
字节开源了一个了不得的模型!
字节跳动开源统一多模态基础模型BAGEL,一个模型能同时理解和生成文本、图像、视频。部署测试有亮点但效果不稳定,还分享该模型体验Demo、地址及安装使用教程。
相信大模型成本会下降,才是业内最大的幻觉
很多AI创业者认为模型降价能降成本、改善营收。但文章指出,成本下降仅针对老旧模型,最好模型成本大致相同,且模型token消耗激增。还探讨了AI创业商业模式,如按使用量计费、建立高切换成本、垂直整合等。
Meta打碎Transformer 8年铁律!改写AI最底层规则,模型首次冒出潜意识
Meta推出「自由Transformer」新模型,打破自2017年以来GPT模型核心规则,在解码器引入潜在随机变量Z,增加“潜意识”。仅增约3%计算开销,在多测试中超越大规模模型,或开启后自回归时代。
DeepSeek推理最高提速6倍!开源研究:加装「思维进度条」,计算量减少30%
特拉维夫大学团队开发新方法,给LLM推理任务装进度条,控制推理深度和速度。提出“思维进度向量”TPV预测推理位置,干预TPV可“超频”“降频”,模型已在GitHub开源。
火线解析MiniMax招股书!全球领先大模型成本只有OpenAI 1%,果然拳怕少壮
上海大模型独角兽MiniMax通过港交所聆讯冲刺IPO。它是全球化AGI科技公司,全模态能力领先且成本低。技术上各模态模型表现出色,采用“模型即产品”模式获客,财务业绩向好,团队年轻高效。
Qwen新开源,把AI生图里的文字SOTA拉爆了
通义模型家族新开源图像生成模型Qwen - Image,是通义千问系列首个图像生成基础模型。实测其对提示词理解到位,文字渲染高保真。它具备复杂文本渲染、一致性图像编辑能力,在多基准测试达SOTA。
谷歌Transformer过时了?清华姚班校友等三连击,爆改注意力!
谷歌提出新架构,参数减少40%,训练速度较RNN提升5 - 8倍,某些任务性能超Transformer 7.2%。新架构引入注意力偏向策略,用「保留」取代「遗忘」,还提出Moneta、Yaad、Memora三个新模型,在多任务上表现卓越。