「前缀和计算」共找到 7335 篇相关文章
单卡搞定万帧视频理解!智源研究院开源轻量级超长视频理解模型Video-XL-2
智源研究院联合上海交通大学等机构发布新一代超长视频理解模型Video-XL-2。它单卡能处理万帧视频,编码2048帧仅需12秒,在效果、长度和速度上全面优化,已开放模型权重。
Meta新突破!跨模态生成告别噪声:流匹配实现任意模态无缝流转
Meta与约翰霍普金斯大学联合推出CrossFlow框架,实现跨模态生成新突破。它基于流匹配提出新范式,无需依赖噪声分布等,在多任务上媲美或超最优算法,训练成本低、速度快,还能适配多任务。
音频大模型安全可信度的全面“体检”!6大维度,清华南洋理工联手打造
南洋理工和清华团队提出新框架AudioTrust,将ALLMs评估扩至六个核心维度,探究音频模态特有问题。目前基准及平台已开发,揭示了开源与闭源ALLMs在多维度的潜在风险。
360开源高质量图文对齐数据集!收纳1200万张图像+1000万组细粒度负样本,让模型告别“图文不符”
360人工智能研究团队的冷大炜博士团队开源FineHARD高质量图文对齐数据集,包含1200万张图像、4000万个边界框及对应描述、1000万组细粒度难负样本,能提升模型图文对齐能力,还介绍了构建方法、分析及应用前景。
OpenAI未公开的o3「用图思考」技术,被小红书、西安交大尝试实现了
OpenAI推出的o3推理模型打破传统文字思维链边界,实现图像融入推理过程。小红书与西安交大联合构建多模态深度思考模型DeepEyes,尝试实现类似能力,还开源技术细节,在多任务中表现出色。
阿里通义开源「推理+搜索」预训练新框架:小模型媲美大模型,多个开放域问答数据集表现显著提升
阿里通义实验室开源通用预训练框架MaskSearch,引入检索增强型掩码预测任务,兼容两种训练方法。实验显示,它在多数据集提升模型性能,小模型能媲美大模型,还验证了训练方式、策略及奖励函数的效果。
中学生就能看懂:从零开始理解LLM内部原理【九】| 层归一化:神经网络的稳定器
本文是系列文章第九篇,介绍了神经网络中的层归一化。先回顾标准差、标准分概念,指出其可使差异可控稳定。接着说明层归一化将原思想用在神经网络,还加入可学习参数,最后总结其作用与应用位置。
经济学人:为什么 AI 还没抢走你的饭碗?
尽管先进AI模型能力强,引发人们对失业的担忧,但实际情况是,口译翻译等领域就业人数增长,年轻毕业生失业率低,白领岗位未受负面影响,全球就业仍强劲,或因AI使用率低及公司不轻易裁员。
Multi-Agent 的灵活编排之路
文章从Copilot 3.0架构规划模块出发,结合DeepSeek R1强化学习训练实践,探讨多智能体架构下大模型编排智能体解决问题。分析Copilot 2.0局限并介绍3.0升级,指出难点,展示效果对比及解决方案。
模型越聪明越“不听话”?MathIF基准揭示AI服从性漏洞
上海人工智能实验室与香港中文大学研究团队发布论文,用MathIF基准揭示大模型“聪明”和“听话”有矛盾,越擅长推理越易忽略指令,还分析了原因并给出让模型更“听话”的方法。