「小喵希拉」共找到 1157 篇相关文章
The Batch: 881 | 一千万 token 的输入上下文
Google的Ali Behrouz等人设计“记忆模块”集成到类transformer架构ATLAS,能处理一千万token输入。它替代注意力层,训练后在长上下文任务中表现佳,但小模型,大规模表现未知。
DeepSeek R2没来,DeepSeek R1+来了~
DeepSeek官方发布通知,DeepSeek R1模型完成小版本升级成DeepSeek - R1+。PaperAgent实测近1000行代码无错,网友测试显示CoT有显著变化、前端审美提升,还提及DeepSeek - R2可能快来了。
Andy Pavlo:2025年数据库年度回顾
Andy Pavlo回顾2025年数据库领域,提及PostgreSQL发展、MCP支持情况、MongoDB起诉案、文件格式竞争等。还介绍收购、合并、融资等动态,以及数据库元老拉里·埃里森的成就,最后给出建议并提及新创业公司。
用 Docker 跑大模型训练,Unsloth 解决了环境配置难题
Unsloth AI 发布 Docker 镜像版本,解决本地训练大模型环境配置难题。拉镜像就能训练,依赖和示例 notebook 都打包好。使用简单,不过有暂不支持 Mac 系统等限制,单卡 NVIDIA GPU 场景较适用。
独立自主梦太多,是国产化的最大阻碍
我国虽建立完整工业体系,但 IT 领域差距大。国产基础组件百花齐放,给上层应用适配带来灾难。美国在基础能力上近乎垄断,大投入保持领先。国内小投入难出好产品,应整合市场。
美光三星海力士遭集体诉讼!郭明錤:27年都买不到便宜内存
17名美国消费者和小企业主起诉三星、SK海力士和美光,指控其合谋减产、抬高内存价格。二十年前它们就有类似前科。郭明錤预计‘内存荒’至少持续到2027年,这让诉讼意义复杂。
Kimi团队深夜潜入Reddit开了场AMA,他们都聊了些什么?(据说代号4494就是杨植麟本人)
今日凌晨,Kimi团队在Reddit社区开展AMA交流,解答大家疑问。期间回应Claude蒸馏争议,探讨编程写作侧重、小参数模型需求、缩放定律等问题。K2.5表现出色,K3值得期待。
AgentCPM-Explore开源,4B 参数突破端侧智能体模型性能壁垒
清华大学、中国人民大学等联合研发的 AgentCPM-Explore 开源,基于 4B 参数在深度探索任务上表现出色,打破参数壁垒,开源全流程基建,还探索出提升小模型性能的方法。
AAAI 2026 Oral|InfiGUI-G1模型来了,刷新GUI Grounding SOTA
多模态大语言模型发展下,GUI Grounding任务是难题,现有RLVR方法有瓶颈。浙江大学等团队提出AEPO框架,推出InfiGUI - G1系列模型,小参数量刷新GUI基准测试SOTA,代码已开源。
新型「验证码」诞生?这张图让 ChatGPT、Claude、Gemini 都翻了车
网友用光学错觉图捉弄大模型,人眼秒懂的图案让ChatGPT、Claude、Gemini等翻车。有人认为可作AI检测器,也有人质疑其测试有效性,此外还有其他好玩的小测试。