「模型1.6」共找到 8618 篇相关文章
告别昂贵人工标注,英伟达全自动视频理解助力小模型逆袭顶级大模型
麻省理工、英伟达等推出FoundationMotion,它是全自动数据生成流水线,能解决运动数据稀缺难题。通过自动标注生成问答数据,让小模型经微调后在运动理解上超越顶尖闭源模型,还介绍了其数据生成、问答设计等环节。
小红书团队开源dots.ocr:文档解析新王者,性能比肩Gemini!
文档解析领域处理多语言复杂文档需高效能力,传统OCR工具存在不足。小红书HiLab开源多语言文档解析模型dots.ocr,基于1.7B参数视觉语言模型,性能达SOTA,单页PDF处理快,公式识别媲美大模型。
图解Vllm V1系列6:KVCacheManager与PrefixCaching
文章聚焦vllm v1,阐述调度器取请求时判断设备有无充足空间做推理的问题,涉及KVCacheManager与Prefix Caching。前者管理请求和块,后者通过找最长一致前缀节省显存,还介绍块分配释放策略与流程。
230个大模型在婴幼儿认知题上集体翻车!揭秘多模态大模型的核心知识缺陷
ICML 2025研究揭示多模态大模型在基础认知能力上表现不佳。研究者建测评题库CoreCognition测试230个主流模型,发现其存在核心知识缺陷,扩规模难补短板,还需补齐核心知识。
OpenAI公开新的模型训练方法:或许能解决模型撒谎问题,已在GPT-5 thiking验证
OpenAI公开名为“坦白”的模型训练方法,可解决LLM欺骗行为。该方法强制模型自我反省,“坦白”奖励与“主要回答”奖励分离。在GPT - 5 - Thinking上实验,能提升不良行为可见性,但对“无知的错误”有局限。
Speech LLM 的下一个突破口:你的语音大模型可以是个「带韵律的文本模型」
语音大模型存在‘模态代沟’致性能‘降智’,此前两波改进未根本解决。香港中文大学论文提出TextPro - SLM架构,从输入端破局,仅用约1000小时数据就实现低‘模态代沟’,对多模态模型设计有启发。
特征工程、模型结构、AIGC——大模型在推荐系统中的3大落地方向|文末赠书
文章指出大模型在三个层次改变推荐系统,一是改变“知识学习”方式,带来知识输入革命;二是改变“智能体”结构,探索推荐模型新范式;三是创造“新世界”,实现个性化内容生成。还介绍了相应落地应用及对从业者的建议。
语言模型内部还藏着众多策略模型?自底向上强化学习重塑底层特征 | 直播预约
现有强化学习工作将语言模型作整体策略优化,研究提出以策略视角审视内部隐藏状态,分析层级和模块级策略,发现不同模型模式差异,还提出自底向上强化学习策略,为研究架起新桥梁。
印度国家级大模型上线两天仅 300 余次下载,投资人直呼“尴尬”:韩国大学生模型都有20万!
印度 Sarvam AI 发布国家级模型 Sarvam - M,虽被赞为本土 AI 突破,支持 10 种本地语言,但上线两天仅 334 次下载,投资人批其成绩尴尬,还与韩国大学生模型对比,引发社区争论。
美团杀入视频生成模型赛道,LongCat-Video 136亿参数媲美顶尖模型,效率提升10倍
美团LongCat团队发布LongCat - Video基础视频生成模型,有136亿参数量,多任务表现出色。它核心亮点多,还建立了数据处理流水线,采用特殊架构和训练方法,提升了生成效率,性能媲美顶尖模型。