「中国电信人工智能研究院」共找到 624 篇相关文章
Sora没做到的,LongVie框架给解决了,超长视频生成SOTA
视频生成近年进步大,但生成超1分钟高质量长视频仍难。上海人工智能实验室等机构提出LongVie框架,解决时序不一致和视觉退化问题,还推出评测基准LongVGenBench,该框架在多项指标达SOTA。
OpenClaw的风刮到了多模态生成,6B小模型超越Nano Banana 2!
现在多模态生成模型在复杂指令和下游任务表现不佳。上海人工智能实验室等团队提出GEMS,将OpenClaw成功应用于多模态生成领域,激发小模型潜力,让6B小模型部分任务超越Nano Banana 2。
LaPha:你的Agent轨迹其实嵌入在一个Poincaré球?
经典强化学习动作空间离散有限,但语言模型动作空间几乎无限。上海科学智能研究院联合复旦大学提出LaPha,将智能体行为树映射到潜空间,构造密集奖励、剪枝等,在基准测试中效果显著。
CapRL:用强化学习突破Image Captioning训练瓶颈,3B模型性能媲美72B
上海人工智能实验室联合团队发布 CapRL,首个将 DeepSeek - R1 强化学习策略用于 Image Captioning。CapRL - 3B 模型在图像描述任务媲美 Qwen2.5 - VL - 72B,已开源,团队持续迭代优化。
ICCV 2025 | 机器人自主探索未知复杂空间?GLEAM破解主动探索建图的泛化难题
文章聚焦机器人在未知复杂空间的自主探索建图难题。香港中文大学与上海人工智能实验室联合提出GLEAM,搭建GLEAM - Bench基准,设计通用策略,实现零样本适配未知空间,在多指标上超越先前方法。
最高500万!6个项目签约!“决战紫金之巅”圆满收官 | Q推荐
12月12日,决战紫金之巅——云谷杯・2025人工智能应用创新创业大赛总决赛暨闭幕式在云谷中心举办。活动聚焦AI应用创新及“AI+”融合,现场有政策宣介、圆桌对谈等,6个项目签约,最高可获500万补贴。
智源悟界 · Emu3.5 重塑世界模型格局:首提多模态 Scaling 范式,AI 理解世界再进化
北京智源研究院发布大规模多模态世界模型“悟界·Emu3.5”,它能模拟复杂动态物理世界,揭示“多模态Scaling范式”。该模型继承深化Emu3技术哲学,在多方面有提升,为世界模型领域提供进化路线。
「0污染」LLM理解基准来了!20000道题14个学科全覆盖,来自微软
MMLU-CF是微软亚洲研究院推出的无污染多任务语言理解基准测试,含20000道题、覆盖14学科。通过去污染规则和闭源测试集防数据泄露,保证评估结果可靠,已在Huggingface开放。
不用千亿参数也能合成高质量数据!这个开源框架让小模型“组团逆袭”,7B性能直追72B
上海人工智能实验室与中国人民大学提出GRA框架,以“多人协作”理念让小模型分工生成高质量训练数据。实验显示其生成数据质量高,项目已开源。它打破对大模型蒸馏依赖,展现“集体智能”潜力。
不换模型,效果提升104%!上海AI Lab让Harness也能自进化了
上海人工智能实验室团队提出的Self-Harness引发关注,它针对Agent外层Harness改进。实验显示,在Terminal-Bench-2.0上,不换模型只改Harness,Qwen3.5-35B-A3B等模型效果显著提升。