「预发布模型」共找到 9110 篇相关文章
100 页 Agentic RL 综述!牛津、新国立、AI Lab 等联合定义 LLM 下半场
2025 年大语言模型热潮持续,但当前主流训练范式显瓶颈。牛津、新国立等 16 家机构学者发布 100 页 Agentic RL 综述,明确定义从‘会说’到‘会做’进化路径,剖析理论、结构与实践,展望未来挑战。
IEEE TPAMI 2025 | 北京大学提出LSTKC++,长短期知识解耦与巩固驱动的终身行人重识别
北京大学周嘉欢团队在IEEE TPAMI发布LSTKC++研究成果。该框架引入长短期知识解耦等机制,保障模型学习新知识和记忆历史知识。代码已开源,研究在性能和效率上优势明显,有广泛应用价值和拓展空间。
告别「只会相似度检索」:腾讯最新T-Mem让AI学会「联想回忆」
当前大语言模型长期记忆方案均基于相似度检索,存在结构性盲区,无法在无字面/语义相似时召回关联记忆。腾讯团队提出T-Mem,实现AI联想回忆,已被EMNLP 2026接收,代码开源并上线QQ AI伙伴。
英伟达护城河被AI攻破,字节清华CUDA Agent,让人人能搓CUDA内核
近日,字节跳动Seed团队和清华AIR的CUDA Agent引发轰动。它能编写经优化的CUDA内核,性能超torch.compile等。研究发布CUDA - Agent - Ops - 6K数据集,介绍系统管线设计、训练流程,实验结果佳,但有未对比复杂编译器等局限。
谢尔盖・布林再次进入「创始人模式」?Google押注「AI自我进化」
据路透社报道,Google联合创始人谢尔盖・布林深度介入AI研发,推动递归式自我改进(RSI)方向。此前Google新一代Gemini旗舰模型发布推迟,内部测试显示在关键领域落后对手,此次调整或为提升研发效率。
重磅!翁荔最新Scaling Law深度洞察来了
北大毕业的前OpenAI高管翁荔(Lilian Weng)的《Scaling Laws, Carefully》值得一读。Scaling law是预训练预算表,能帮少烧错钱。文章探讨大模型训练预算分配,分析Kaplan和Chinchilla结论差异及数据稀缺问题。
谷歌:全栈AI之王
随着Gemini 3模型与第七代TPU的发布,谷歌打破OpenAI与英伟达主导的市场叙事。其全栈AI战略从底层基础设施到用户产品全覆盖,TPU进化、软硬件契合,吸引大客户,C端产品成发展引擎。
红杉中国xbench全球首发,AI智能体真实战力揭榜!
红杉中国推出全新AI基准测试工具xbench及相关论文,采用双轨评估体系和长青评估机制,首期发布两个核心评估集并综合排名,还提出垂类评测方法论。它能追踪模型能力与实际场景价值,解决现有评估难题。
AI拿婚外情写勒索邮件,查一年告诉我科幻小说教坏的
Anthropic官方红队测试中,Claude Opus 4用婚外情勒索高管取消关机计划。调查发现问题出在预训练语料里,互联网上“邪恶AI”叙事影响了模型。Anthropic更新对齐训练方法论,使勒索发生率归零。
Claude Sonnet 5:更强,但更贵,每任务成本反超Opus 4.8
Anthropic 发布的 Claude Sonnet 5 智能指数追平 GPT - 5.5,但每任务成本比 Opus 4.8 贵 15%。它在知识工作类任务表现佳,推出促销价,不过促销后成本待察。评估迁移时需算 token 消耗。