「参数量」共找到 1240 篇相关文章
We-Math 2.0:全新多模态数学推理数据集 × 首个综合数学知识体系
北京邮电大学、腾讯微信、清华大学团队提出We - Math 2.0,含知识体系、数据集及训练策略,可提升模型数学推理泛化能力。该成果在X上获关注,登Huggingface Paper日榜第一。
ICCV 2025 | 打造通用工具智能体的基石:北大提出ToolVQA数据集,引领多模态多步推理VQA新范式
北大团队提出ToolVQA数据集,用于提升基础模型工具使用能力。它含2.3万条样本,贴近真实需求。通过ToolEngine构建,涵盖多工具与任务领域。微调后模型表现佳,代码与模型已开源。
The Batch: 863 |推理提高了碳排放
新研究量化推理模型时代提供更优答案的环境成本,研究人员估算14个开源权重的大模型碳排放,发现推理与排放存在权衡关系,还指出战略性部署可降低排放。
刚刚,智谱开源了他们的最强多模态模型,GLM-4.5v。
智谱接连开源GLM - 4.5和GLM - 4.5V,后者为多模态模型,总参数106B,在42个评测基准中41个达到SOTA。经测试,它视觉推理强、速度快,还有视频理解等功能,API定价良心,体现持续开放精神。
Attention Sink产生的起点?清华&美团首次揭秘MoE LLM中的超级专家机制
清华和美团研究聚焦MoE LLM,首次发现超级专家子集。通过多模型实证分析,揭示其分布规律、重要性及对注意力机制的影响,开发识别工具,为模型压缩提供新方向。
兔子蹦迪疯传,5亿观看!全球恐慌:一段AI视频把全人类拉入虚拟现场
一段兔子深夜「蹦迪」的AI假视频骗了全球上亿人,在TikTok引发大量转发。因监控画面模糊、背景静态等,它难以识破。随着AI发展,真假视频难辨,引发人们对区分虚拟与现实的思考。
AI“压力面”,DeepSeek性能暴跌近30% | 清华&上海AI Lab
上海人工智能实验室等团队设计REST框架,在一个prompt里抛多个问题模拟多任务推理场景。测试发现即便顶级模型如DeepSeek - R1在“高压”下准确率也骤降,该框架能揭示模型差异,为评测提供新范式。
硅谷大戏!Scale AI刚卖身就被集体拉黑,谷歌OpenAI无情断供
Meta花143亿美元收购Scale AI近半股份,交易达成后数小时,Google、OpenAI和xAI暂停与Scale AI部分合作。其竞争对手客户咨询、求职兴趣大增,还打响人才争夺战,重塑了市场格局。
Anthropic CEO发出警告:“未来五年,半数入门级白领工作或被AI吞噬,失业率恐飙升至20%!”
Anthropic CEO Dario Amodei 警告,未来五年半数初级白领岗位或被 AI 吞噬,失业率恐升至 20%。招聘数据显示初级岗位正减少,AI 蚕食基础技能,年轻人职场门槛被垫高。业内建议求职者把 AI 当助手。
The Batch:820 | Qwen3 向 DeepSeek-R1 发起挑战
阿里巴巴发布八个大型语言模型权重,含两个 MoE 架构和六个稠密模型。预训练数据达 36 万亿 token,支持 119 种语言及方言。测试中 Qwen3 家族表现出色,或终结 DeepSeek - R1 霸主地位,设计用于智能体系统。