「泛化能力」共找到 3356 篇相关文章
开源8300小时标注数据,新一代实时通用游戏AI Pixel2Play发布
随着AI在代码和图片生成领域成熟,研究人员开始关注其在游戏领域的表现。此前的专用模型缺乏跨游戏泛化能力,通用模型在游戏环境中表现不佳。为此,Player2研究员提出Pixel2Play模型,还开源了代码和数据集。
0.3B参数,600MB内存!腾讯混元实现产业级2Bit量化,端侧模型小如手机App
腾讯混元团队推出面向消费级硬件的“极小”模型HY-1.8B-2Bit,参数量仅0.3B,内存占用600MB。它基于产业级2Bit端侧量化方案,生成速度提升,还通过多种方法提升能力,未来将探索新技术缩小与全精度模型差距。
LLM-based Agent的代码生成综述
这篇2025年的综述指出,传统代码生成技术难完成复杂开发任务,而基于大语言模型(LLM)的代码生成代理应运而生。它把LLM作为“大脑”,具备自主规划等能力。文章梳理了该领域的核心特征、技术体系、应用实践等,也剖析了挑战与未来方向。
发布智驾商用方案,千里科技的转身与雄心|甲子光年
今年6月23日,千里科技发布面向L2+级的千里智驾1.0,公布L3、L4级产品路线图。其前身是力帆科技,转型后与吉利合作。该方案分三版本,还将推L3、L4级别方案。公司有“一横一纵”能力,站位供应商。
补上OpenClaw最大短板!中国AI独角兽亮出龙虾盒子,打工人放心养虾
OpenClaw热潮下,云端隐私数据保护缺位,端侧算力和全模态脱敏能力不足制约其落地。无问芯穹推出InfiniClaw Box,具备多信源融合等能力,采用端云一体架构,实现隐私安全与大模型能力融合。
大模型在具身推理上「翻车」了?4496 道题全面揭示短板
美国东北大学等提出BEAR基准评估MLLM具身智能子能力,用4496道题测试20个模型。发现多模态大模型具身能力不足,还分析错因,开发BEAR - Agent提升模型具身推理能力,在仿真测试中效果显著。
GLM-5真够顶的:超24小时自己跑代码,700次工具调用、800次切上下文!
GLM - 5正式发布,把开源AI带入长任务时代。它超24小时自己跑代码,完成GBA模拟器,能力稳定。评测结果佳,在主流测试中编程能力与Claude Opus 4.5对齐,引发网友欢呼。实测还展现多种应用能力。
百度搜索 10 年来最大改版,支持超千字长文本输入和 MCP 调用
7月2日,百度搜索宣布十年来最大改版,搜索框变“智能框”,支持超千字输入,集成AI写作等功能。“百看”功能、AI助手升级,接入视频生成模型MuseSteamer,还接入1.8万+MCP,提升搜索体验。
Sora2甚至可以预测ChatGPT的输出
Sora2表现太卷,能预测ChatGPT输出,模拟交互还能渲染HTML,懂代码也懂物理,能体现玻璃折射现象,还能精准还原游戏支线任务关键要素,或基于LLM训练。
真实科研水平集体不及格!全新基准SFE给主流多模态LLM来了波暴击
上海人工智能实验室AI4S团队推出SFE评测基准,首创三级评估体系,涵盖五大科学领域66项任务。评测显示主流MLLMs在高阶科学任务有挑战,不同模型、学科表现有差异,还构建了SciPrismaX平台推动AI科学评估生态发展。