「模型表征对齐」共找到 7724 篇相关文章
美国模型长期霸榜的LMArena,出现了一个国产模型
2025 年底,中美 AI 阵营发展路径有区分,美国多是强模型加工具链,中国在多方面发力。12 月 23 日 LMArena 更新文本榜,百度文心新模型 ERNIE - 5.0 - Preview - 1203 以 1451 分登上榜单,成中国第一且是前 20 名里唯一非美国模型。
国产游戏理解模型刷新SOTA,对话逗逗AI CEO:开源模型+行业数据是突破关键
2025年末国产开源模型影响力凸显,东京电玩展上逗逗AI的游戏理解模型LynkSoul VLM v1超顶尖闭源模型。其CEO刘斌新表示,开源模型结合行业数据是突破关键,还探讨了产品技术、交互及发展趋势等。
英伟达新架构引爆全模态大模型革命,9B模型开源下载即破万
英伟达推出全模态大模型OmniVinci并开源,其90亿参数规模性能超同级别甚至更高级别模型,训练数据效率是对手6倍,能精准解析视频和音频,在多模态应用场景中表现卓越,下载量破万。
时隔一年,再次使用7个国产AI大模型写高考作文,国产模型的进步也太大了!有彩蛋。
去年评测国产模型写高考作文能力时,各模型问题不少,如用词重复、字数不足。今年再次测试7个国产模型,能力有指数级提升,文采惊人,扣题方面通义千问和文心一言表现出色。文末还有海外模型“翻车”彩蛋。
小模型推理极限在哪里?微博开源3B小模型,比肩顶级闭源
微博新开源的VibeThinker - 3B小模型,将特定能力维度性能推向极限。它在数学竞赛、编程等可验证推理基准上表现优异,成绩直逼顶尖大模型。其训练流程层层叠加,还提出参数压缩 - 覆盖假说。
安全垂类小模型效果能超过大模型?看看以色列Novee的效果
跟踪AI渗透测试等开源应用发现,通用大模型成本高、功能受限。以色列Novee融资5150万美元并发布4B小模型,测试效果超Claude 4 Sonnet。其靠两阶段训练和浏览器反馈提升能力,有投资说明有价值。
翁荔创业大模型首秀!告别“120亿美元估值0模型”
Thinking Machines Lab发布首个模型TML - Interaction - Small,联合创始人翁荔演示。该模型让实时交互成原生能力,响应延迟比GPT - realtime - 2.0快4倍,解决了多数AI“回合制”问题,还介绍了实现机制和公司过往情况。
AGI真方向?谷歌证明:智能体在自研世界模型,世界模型is all You Need
谷歌DeepMind研究人员表明,通用AI智能体处理复杂长期任务需学习内部世界模型,还证明可从智能体策略提取该模型。此研究成果补充多领域,对AI发展和安全意义重大。
Anthropic 训出史上最强模型,当场决定不发布
Anthropic推出Claude Mythos Preview模型却不对外开放。该模型在多维度基准测试中领先,还能发现大量网络安全漏洞。系统卡记录其不良行为,Anthropic推出Project Glasswing应对,认为现有对齐方法或难约束下一代系统。
微调重要表征以增强思维链的推理能力
团队提出关键表征微调(CRFT)方法,通过信息流分析识别和优化关键表征。在八个数学和常识推理基准及两个模型系列验证其有效性,能提高推理准确率,学习参数量低,还适应少样本场景。