推理评估」共找到 2638 篇相关文章

开源动态8

AI秒懂短视频,快手大模型Keye-VL理解力爆表!技术细节全开源

快手全新多模态大语言模型Kwai Keye-VL上线且开源,能深度融合多模态信息,在视频理解、复杂视觉感知和逻辑推理上表现优异。介绍了其技术架构、预训练和后训练策略及训练架构优化等内容。

新智元
推荐文章7

AI Infra 工程师们如何应对大模型流水线里的“暗涌”?

InfoQ《极客有约》X AICon 直播,邀请华为昇腾专家 ZOMI 酱、蚂蚁集团马介悦和 SGLang 尹良升探讨大模型 Infra 工程师实战日常。涉及大模型工程高频问题、版本迭代策略、推理部署优化、开源项目挑战等内容。

InfoQ
开源动态8

2026 AI 大模型技术体系综合开源影响力榜单发布,中国开源实力领跑全球

2026年全球AI产业迈入新阶段,开源生态影响力成关键。4月17日CSDN联合多家机构发布《2026大模型技术体系综合开源影响力榜单》,从四大维度、53项细分指标评估,呈现开源生态地图,助力中国AI开源跨越。

AI科技大本营
算法论文8

半在线RL新范式UI-S1,使得GUI Agent既稳定又规划长远

现有AI训练方法在GUI自动化中各有弊端,本文提出半在线强化学习范式,训练出UI - S1 - 7B模型,性能提升显著,还提出新评估指标SOP,是迈向实用化AI智能体的重要一步。

深度学习自然语言处理
算法论文8

突破Pass@1瓶颈:一种让LLM自我博弈、永不枯竭的RL新范式,超越基线22.8%!

近年来,基于可验证奖励的强化学习(RLVR)在提升大型语言模型(LLM)推理能力上有关键作用,但存在熵崩溃问题。论文提出SVS创新策略,让模型自我合成变分问题形成自我提升循环,实验效果惊人。

深度学习自然语言处理
新闻资讯8

伯克利神作背刺OpenAI:持续学习才是真神!

伯克利等机构发布FST框架,通过快慢分层解决大模型持续学习死局。过去两年头部实验室都在提升模型推理能力,却忽视持续学习。FST让模型像大脑一样快慢分层,提升数据效率、减少遗忘,使持续学习可工程化。

新智元
开源动态8

多模态思维链如何重塑 AI 与短视频的未来

传统多模态模型在动态视频理解与复杂推理场景面临挑战,快手开源的 Keye-VL 模型在多模态思维链技术实现突破。文章解析其核心技术,分享在快手短视频社区的落地应用,还探讨了未来“Think with Video”的技术方向。

AI前线
推荐文章7

为什么我用了那么多提示词模板甚至用了 AI 帮忙还是写不好提示词?

现在很多人觉得模型强大,提示词工程没必要,但复杂需求仍需它。作者以写雷军演讲提示词和YouTube字幕生成提示词为例,介绍迭代创作过程,指出写不好提示词根源是难评估差距和调整。

宝玉AI
产品应用7

新鲜出炉!谷歌nano banana模型刷屏背后技术揭秘

谷歌Nano Banana模型刷屏,其项目负责人等揭秘技术。它有场景一致性、文本渲染等特性,团队用文本渲染能力作评估指标,还靠原生多模态、交错式生成等技术,结合用户反馈实现多方面进步,图像模型做PPT尚处起步。

AI寒武纪
新闻资讯7

Claude Sonnet 5 上线一日差评刷屏:打不过千问和 Minimax,性价比全面翻车

Claude Sonnet 5发布一天差评多。虽官方定位高,有能力亮点,但在中文测评中性价比低,测试成本高,且Max推理模式易过度思考。还因过度保守失去实用价值,其表现取决于使用场景和预算。

AI科技评论