「AI测试集」共找到 10975 篇相关文章
DeepSeek-V3.1震撼发布,全球开源编程登顶!R1/V3首度合体,训练量暴增10倍
DeepSeek正式上线DeepSeek-V3.1,作为首款「混合推理」模型,将开启智能体新时代。它参数共671B,具强大智能体能力,编程击败Claude 4,训练量大幅扩增,在多方面测试表现出色,稳坐编程开源第一王座。
One RL to See Them All?一个强化学习统一视觉-语言任务!
国内初创公司 MiniMax 提出 V-Triune 系统,可让 VLM 单一训练流程学视觉推理和感知任务。它含三个组件与动态 IoU 奖励机制,基于此的 Orsta 模型在多项测试中性能提升显著,凸显统一 RL 方法有效性和可扩展性。
腾讯把WorkBuddy这张王牌,开放给100多家公司|甲子光年
9月2日,腾讯WorkBuddy举办生态发布会,开放平台正式上线,首批引入超百家生态伙伴,开放底层Agent能力。其在AI办公赛道竞争激烈、产品同质化的背景下做出此开放动作,且面临生态繁荣、商业化等问题。
CVPR 2026|用互联网视频替代3D标注:通研院团队打造SceneVerse++「最大规模」真实3D场景数据
北京通用人工智能研究院团队在CVPR 2026接收论文中,提出自动化数据引擎,用互联网视频构建SceneVerse++数据集,规模超现有同类,在3D检测、VQA、VLN任务提升性能,还指明3D空间智能发展方向。
监管叫停外资收购Manus背后,有一个被忽视的关键问题|甲子光年
4月27日,国家发改委叫停外资收购Manus项目。该项目从2025年12月Meta宣布收购起备受关注。此次监管选择外商投资安全审查路径,预示AI时代监管侧重技术控制权,也可能加速VIE架构消亡。
142 TFLOPS 的差距:为什么在 Blackwell 上 FP4 MoE 算子工程至关重要
文章对三种主流MoE后端在Blackwell B200 GPU上做基准测试,发现SGLang与vLLM有142 TFLOPS差距,小batch时SGLang快1.84×。差异源于kernel融合、面向Blackwell的CUTLASS schedule及自适应grid sizing等优化。
DeepSeek V3到V3.2的进化之路,一文看全
知名AI研究者Sebastian Raschka发布深度博客,详细梳理DeepSeek V3到V3.2进化历程。DeepSeek V3.2性能对标GPT - 5和Gemini 3.0 Pro,且为开放权重模型,报告涵盖众多有趣领域和知识。
开源!强效果,高性能,严隐私?我全都要:OPPO 终端大模型实践
OPPO AI 中心推出开源端侧多模态大模型 AndesVL,含 0.6B - 4B 四档尺寸套件,有通用能力强等优势。它经多阶段训练,OPPO 还构建端侧部署方案,评测显示其在多方面表现优异,未来会继续技术革新。
奥特曼和量子计算奠基人讨论GPT-8
奥特曼在节目中与量子计算奠基人戴维・多伊奇就AI能否发展成有意识的超级智能产生分歧。奥特曼搬出GPT - 8举例试图说服对方,引发网友对AGI定义标准的讨论。
讲习班日程公布|第四届全国大模型智能生成大会(LMG 2025)
第四届全国大模型智能生成大会(LMG 2025)11月1 - 3日在成都召开,预计超千人参会。11月3日的讲习班邀请四位青年专家,围绕AI基础设施、扩散语言模型等前沿议题,分享技术进展与实战经验。