「B站」共找到 870 篇相关文章
LLM工业级自进化:北邮与腾讯AI Lab提出MoE-CL架构,解决大模型持续学习核心痛点
北邮百家AI团队与腾讯AILab提出MoE - CL架构用于LLM自进化持续指令微调。其结合‘解耦LoRA专家’与‘GAN对抗降噪’,在腾讯业务及基准测试中效果佳,降低人工成本,准确率优于主流方法。
国产开源LLM迎来大爆发的一周:Kimi、腾讯、快手、美团、面壁智能
国产开源大模型迎来爆发,快手、月之暗面、美团、面壁智能、腾讯等接连发布新模型,如快手Keye-VL - 1.5 - 8B刷新视频理解SOTA,美团LongCat - Flash - Chat推理快成本低等。
对话心资本吴炳见:我不问AI创业的“终局”|甲子光年
本文是对心资本合伙人吴炳见的访谈。他2022年底All in AI,分享投资理念,如共鸣时投资、关注当下问题;分析AI发展阶段、应用情况,认为Agent是核心应用形态;还谈及投资案例、学习方式及经验复用与摒弃等。
Hinton能重新坐下了,什么时候开始的?
AI教父Geoffrey Hinton来上海了,他曾因腰伤近18年几乎无法坐下,如今却能安然坐下。本文讲述他科研生涯,从坐冷板凳到引领深度学习变革,又在AI发展巅峰时反思风险,提醒人们警惕。
智谱发布GLM 4.5,不仅开源模型还把训练框架也开源了
智谱AI发布GLM 4.5,不仅开源模型,还开源整套后训练基础设施。模型规格亮眼,性能也超越qwen 235b。其开源的训练框架slime专为强化学习扩展设计,完整工具链支持多种模型。
如何将LLM的"思考习惯"迁移到视觉领域?
传统多模态模型处理复杂视觉推理能力不足,OVR团队以Qwen2.5 - VL - 7B为基础构建开源强化学习框架,成果模型OVR在12个基准测试刷新记录,揭示认知行为跨模态迁移三条黄金定律。
AICon上海演讲精华回顾:《GMI Cloud 全球化高性能分布式推理服务构建实践》
AICon2025上海站,GMI Cloud资深架构师Frank Lee分享《GMI Cloud全球化高性能分布式推理服务构建实践》,介绍其推理平台,拆解扩缩容等能力,分享架构设计、部署及优化实践,揭秘推理提效关键路径。
VLM会描述视频,却未必用对参考图:RefCaptioner让参考图与视频语义精准对应
多模态大模型处理多参考图与视频对应关系能力不足。为此提出 RefCaptioner,强化模型对参考图识别感应能力、优化输出格式与奖励函数;还构建 MRVBench 评测基准,实验显示其表现优异。
DeepSeek-V4-Flash正式版发布并开源,全面超越V4-Pro预览版
DeepSeek-V4-Flash正式版发布并开源,这一304B轻量级模型经后训练,性能远超V4-Pro预览版,与Claude Opus-4.8接近。模型权重开源后上Huggingface趋势榜第二,性价比高,实测表现佳。
腾讯Hy3正式版亮相,幻觉率更低,Agent能力更强
7月6日腾讯Hy3正式版上线并开源,总参数量295B。它幻觉率从12.5%降至5.4%,Agent能力大幅提升,在生产力场景表现出色,基准测试结果良好,价格有优势,腾讯内部9条线已接入。