「1.5B 模型」共找到 9145 篇相关文章
抗干扰能力提升近40% !无需对抗训练,北航上海AI Lab新蒸馏方法提升模型鲁棒性 | ICML 2025
在人工智能模型规模持续扩大的今天,数据集蒸馏方法能提升训练效率、降低成本,但蒸馏模型在安全性要求高的任务中抗干扰难。北航上海AI Lab团队提出ROME方法,无需对抗训练,显著提升模型鲁棒性,成果被ICML 2025接收且已开源。
AI生成视频总不符合物理规律?匹兹堡大学团队新作PhyT2V:不重训练模型也能让物理真实度狂飙2.3倍!
匹兹堡大学团队提出 PhyT2V 框架,论文已被 CVPR 2025 接收。该框架不依赖重训练或大量外部数据,通过链式推理与迭代修正机制,增强主流 T2V 模型物理场景泛化与生成能力,应用前景广。
对话百度文库:不做大模型能直接做的事,能力积累换来竞争壁垒|AI产品Time
百度文库从文档检索平台转型为一站式AI内容获取和创作平台,付费用户超4000万,AI MAU近亿,智能PPT访问量全球第一。访谈中,负责人分享产品理念、优势及运营经验,如不走大模型能直接做的事,从用户需求出发开发功能等。
100万亿Token揭示今年AI趋势!硅谷的这份报告火了
OpenRouter和a16z联合发布《State of AI:An Empirical 100 Trillion Token Study with OpenRouter》,基于100万亿Token分析模型真实使用情况,揭示2025年AI发展趋势,如开源模型崛起、推理模型成新范式等。
Evaluation is All You Need:评估设计的微小差异如何扭曲结果
论文以DeepSeek - R1 - Distill系列模型为例,指出大模型评估中看似客观的基准测试结果对评估细节极度敏感,细微评估条件变化会致分数波动大,削弱模型对比可信度,呼吁建立新评估标准。
国产LLM又迎来一波开源潮:Qwen、华为盘古、腾讯混元、小米~
本周国产开源LLM集中爆发,Qwen、华为盘古、腾讯混元、小米等接连发布模型。如Qwen3 - 4B性能提升,Qwen - Image文生图能力强;华为开源盘古模型并宣布CANN开源;腾讯混元小尺寸模型特点多且已落地业务。
刚刚,Claude两个新模型曝光!
开发者在Anthropic的API中发现Claude的两个新模型代号claude - marshmallow - eap和claude - melon - eap,目前处于内部测试阶段。社区有多种推测,且Anthropic命名风格改变,新模型或下月发布。
卡帕西入职Anthropic仅两月疑离职;日媒拆解宇树G1后认输:短期内赶不上中国;腾讯317万年终奖员工被辞退:永不录用|AI周报
这篇 AI 周报涵盖诸多热点,如 AI 大神 Karpathy 入职 Anthropic 两月疑离职;Kimi K3 超越闭源模型引关注,美指控其蒸馏美模型;腾讯员工晒 317 万年终奖被辞退;360 首任董秘追讨股权;多家公司有模型发布、业务调整等动态。
打破数据质量鸿沟!清华腾讯Bee项目发布1500万高质量数据集,刷新MLLM全栈开源SOTA
全开源多模态大模型性能被闭源和半开源模型“卡脖子”,根源在于数据质量。清华与腾讯混元团队推出Bee项目,有三大核心贡献,产出的Bee - 8B模型表现领先,证明保证数据质量比堆量更有效。
OpenAI推迟开源大模型发布
OpenAI联合创始人兼CEO Sam Altman宣布本周不发布开源模型,因需更多安全测试。他曾透露要推可下载、自主运行且能力强的开源模型,此前6月也因安全测试推迟发布。