「token定义权」共找到 1162 篇相关文章
OpenVision 2:大道至简的生成式预训练视觉编码器
多模态大模型浪潮中,视觉模块是关键。此前OpenVision训练管线复杂,成本高。研究者提出OpenVision 2,移除文本编码器与对比学习,引入随机丢弃视觉token技巧,性能佳且效率高,挑战了对比学习范式。
美团开源Agentic新王,速度拉满,工具调用打爆Kimi?
周末美团开源LongCat - Flash大模型,参数量560B,推理速度达100 token/s,成本低,在Agent工具调用表现超Kimi - K2。它有Zero - Computation Experts和ScMoE创新,不过市场表现未获太多认可。
突发!字节开源 36B 模型Seed-OSS
字节跳动Seed团队开源Seed-OSS系列36B模型,用12T tokens训练,采用Apache-2.0许可证。该模型能灵活控制推理预算,有两个基座版本,Instruct版在多方面表现强劲,性能碾压OpenAI开源模型。
训练提速5倍,响应缩短50%:动态自感知能力,重塑高效LLM Reasoning范式
大型语言模型“思维链”技术有冗余,传统优化方案存在静态先验与动态能力错配问题。论文提出的DR.SAF框架赋予模型动态自感知能力,通过三模块协作,实现推理“精准瘦身”,解决根本冲突。
万字解码 Agentic AI 时代的记忆系统演进之路
文章深入探讨 Agentic AI 时代记忆系统,介绍记忆对智能体的重要性、人脑与智能体记忆的定义分类及操作,还分析 Memory Bank、LETTA 等多款产品实现,总结技术演进趋势,最后提及 Tablestore 的优势。
与三位前沿研究者聊AI Agent:规则、环境与热潮下的真问题|五源小酒馆Vol.31
五源小酒馆对话三位AI Agent前沿研究者,探讨其发展进展、挑战。他们分享对Agent定义、能力边界判断等,提及过去技术突破,如DeepSeek工作,也指出通用Agent瓶颈,探讨未来模型能否提有价值问题等。
爆肝一周看6小时长视频,解读AI时代程序员价值几何
作者花一周看完Lex Fridman对丹麦传奇程序员DHH的6小时访谈。DHH分享编程经历,谈对流行技术看法,认为AI不能取代人类创造力,还谈及创业、开源等观点,展现深刻认知与独特态度。
大模型时代,通用视觉模型将何去何从?
过去通用视觉模型(VGM)是研究热点,想实现‘视觉模型大一统’。但大语言模型发展使研究热点转移,视觉‘独立性’被重新定义。清华鲁继文团队综述梳理其进展,探讨现状、挑战与应用潜力。
性能比肩DeepSeek-R1,MiniMax仅花380万训出推理大模型性价比新王|开源
MiniMax开源推理大模型MiniMax - M1,原生支持100万token输入、8万输出,性能比肩DeepSeek - R1,仅花380万训成。采用Lightning Attention机制与CISPO算法,在多领域表现出色,模型权重可在HuggingFace下载。
都在问世界模型怎么落地,PixVerse把答案做成了「好玩」
互动式娱乐市场正在爆发,PixVerse推出实时视频世界模型R2版本。该版本让用户真正和世界交互,解决实时视频世界模型持续scaling问题,从内测case来看玩法丰富,其底层技术也有大幅改进。