「自回归模型」共找到 8348 篇相关文章
Moonshot AI发布Kimi Linear技术报告,采用混合线形注意力架构
Moonshot AI在Hugging Face发布Kimi Linear技术报告,该48B参数模型采用混合线性注意力架构,称超越传统全注意力机制。官方数据体现其优势,模型已开源,社区反应不一,MiniMax则回归全注意力架构。
GPT-6 或有"生命"!MIT新作实现LLM自我进化,冻结权重时代终结
MIT新作《Self-Adapting Language Models》实现LLM自我进化,SEAL框架让模型自己生成“自编辑”微调自身。它能实时学新数据、修复知识、形成记忆。经两种场景验证,小模型也能超越GPT - 4.1等。
Astra 的 Computer Use 能力是如何实现的?
本文编译自Browserbase增长工程师Kyle Jeong的个人博客,对比了纯视觉路线Computer Use模型的缺陷,详细拆解Astra模型利用无障碍树结合Codex Harness实现能力的架构、训练方法,分析其优劣与行业价值。
AI全面爆发后,企业正在悄悄争夺知识库入口|甲子光年
AI幻觉问题让企业意识到通用模型在专业场景的局限,需构建企业级知识库。腾讯在峰会上宣布升级知识库产品,乐享知识库通过AI赋能解决数据整合、更新等痛点,未来知识库将与业务深度联动。
世纪反转:“安卓爹”谷歌成 iPhone“大脑供应商”?曝苹果每年掏70亿换定制Gemini,明年上线新Siri
彭博社报道苹果将与谷歌合作,每年付约10亿美元获定制Gemini用于升级Siri,计划明年春季推出。谷歌模型参数远超苹果现有模型,能让Siri功能更强大,且运行在苹果私有云。
千人千面的真人级AI名师,劈开教育「不可能三角」
与爱为舞推出的AI导师能个性化教学,服务百万用户。其用「模型+语音+工程」铸造技术巨剑。经训练,AI可驾驭课堂,再经自研语音模型实现交互,通过链路优化等实现规模化落地,践行「全员皆超级个体」理念。
LLM加RL遭质疑:故意用错奖励,数学基准也显著提升,AI圈炸了
华盛顿大学等机构论文引爆AI界,其发现用虚假奖励训练Qwen2.5-Math-7B模型,也能提高MATH - 500成绩。虚假奖励对Qwen模型有效,但在其他模型上有限,凸显RLVR有效性与模型能力有关。
都标5美元,账单差三成!OpenAI高管:token从来没法直接比价
OpenAI Codex负责人Tibo指出,不同模型对同一段文字切分的token数不同,即便单token价格相同,最终账单也可能差异很大。他还提到,token无统一计量标准,跨厂商和新旧模型计数都难通用,真正重要的是每次成功结果的成本。
3B激活参数!商汤绝影Sage登顶PinchBench,端侧第一
商汤绝影Sage端侧大模型在PinchBench评测中,以94%任务完成率超越Claude、GPT - 5.4等主流大模型。它激活参数仅3B,算力需求低,还具备多项实用场景能力,靠SCOUT和ERL两项自研技术提升性能。
deepseek v4.1? 梁圣的端午礼物突袭。
群里小伙伴称deepseek官方灰度新模型,手机和web端Flash模型思考模式大变,典型bug修复。测试发现幻觉严重,知识库截止大概25年6月。同时,deepseek获500亿首轮融资,梁文锋自掏200亿,投资方无投票权,五年锁定期。