「评测环境」共找到 1070 篇相关文章
AAAI 2026 Oral | 悉尼科技大学联合港理工打破「一刀切」,联邦推荐如何实现「千人千面」的图文融合?
悉尼科技大学龙国栋团队联合港理工杨强、张成奇团队提出 FedVLR 框架,解决联邦环境多模态融合异质性难题,被 AAAI 2026 接收。该框架创新性强,可提升推荐指标,代码已开源。
让模型“看视频写网页”,GPT-5仅得36.35分!上海AI Lab联合发布首个video2code基准
上海人工智能实验室等机构提出IWR - Bench评测基准,从“image - to - code”迈向“video - to - code”,对28个主流模型测试,最佳模型GPT - 5仅36.35分,指出当前模型短板,为研究指明方向。
GPT-4o-Image仅完成28.9%任务!上海AI实验室等发布图像编辑新基准,360道人类专家严选难题
上海人工智能实验室等团队针对图像编辑AI提出问题,推出RISE任务及配套评测基准RISEBench。测试九个视觉编辑模型,结果显示当前模型完成复杂指令能力欠缺,闭源与开源差距大。
16岁天才少年炒掉马斯克,空降华尔街巨头!9岁上大学,14岁进SpaceX
16岁天才少年Kairan Quazi从英特尔实验室、圣克拉拉大学到SpaceX,如今炒掉马斯克,加入金融巨头Citadel Securities。他爱折腾,追求高挑战,看重公司文化与包容,其家庭环境也影响职业选择。
炸裂!微软开源Windows子系统
今天凌晨微软宣布开源适用于Linux的Windows子系统WSL。它能让开发者在Windows上运行Linux环境,无需虚拟机或双引导。还介绍了WSL工具、架构及文件共享机制,回顾其发展历程。
清华发布智能体社会AgentSociety第二代:让社会科学研究真正「跑起来」
AgentSociety²是清华团队推出的社会科学研究新工具,让AI扮演研究助手和实验参与者角色。它打通研究断点,实现从「社会模拟」到「可执行社会科学」的转变,还构建工作流、创新实验环境和智能体设计。
OpenClaw长期记忆:优秀管线与玄学效果
文章拆解 OpenClaw 记忆系统全链路,指出其虽设计理念好,但记忆效果不稳定。介绍 RDSClaw 记忆插件如何补强,该插件与原生系统协作,提升记忆稳定性,在 LoCoMo10 评测中成绩显著。
字节发布全球首个预测未来基准FutureX,Grok-4 拿下冠军
字节跳动发布全球首个实时未来预测基准测试FutureX,杜绝模型作弊。在25个模型评测中,Grok - 4夺冠。它从多网站构建问题,分四级难度。人类专家在部分等级仍领先AI 。
CVPR Highlight|让无人机学会自己认路+锁位目标,国防科大给出一套新解法
国防科技大学 SAW Lab 团队联合多高校推出无人机实时地理定位系统「PiLoT」,首次仅靠单目 RGB 序列在 GNSS 拒止环境完成无人机及目标定位,性能达先进水平,成果被 CVPR 2026 接收。
Lumina-DiMOO:多模态扩散语言模型重塑图像生成与理解
上海人工智能实验室推出多模态扩散语言模型 Lumina - DiMOO,它基于离散扩散建模,打破多模态任务壁垒。相比传统自回归架构模型,它解决了生成慢、质量受限等问题,在多项评测中夺魁。