「代码评估」共找到 2298 篇相关文章
腾讯混元世界模型HY-World 1.5开源,24 FPS的实时交互世界建模
腾讯混元世界模型HY - World 1.5开源,实现24 FPS实时交互世界生成。它采用双重动作表征等技术,解决了长程生成问题,还通过强化学习等优化,在多方面表现出色,为具身智能场景模拟奠基。
准确率腰斩!大模型视觉能力一出日常生活就「失灵」
EgoCross项目团队聚焦跨域第一视角视频问答评测,揭示现有MLLM在多场景泛化瓶颈。团队提出跨域第一视角视频问答基准EgoCross,经测试揭示模型短板,验证改进方法潜力,研究入选AAAI 2026且数据集等已开源。
OPPO AI重磅发布:深度研究智能体,离“真正好用”还有多远?我们给大模型做了一次全身体检
2025年,Deep Research成AI热点,OPPO AI Agent Team对大模型评测。发布论文,开源评测基准FINDER和失败分类体系DEFT,揭示AI“装懂”“缺乏韧性”问题,还分析模型表现并给出发展建议。
360发布全球最强视觉语言对齐模型!榜单全面领先!
360发布FG - CLIP 2双语细粒度视觉语言对齐模型,几乎在所有数据集上全面领先。它能让AI在统一框架内看懂图像细节、理解中英双语,团队还提出新中文多模态评测基准。
Groupe SNCF 使用 Talos OS 和 Kubernetes 实现基础设施的现代化
法国国家铁路集团(Groupe SNCF)从传统 VM 的 Kubernetes 部署迁移到基于 Talos OS 和 OpenStack 的云原生平台,解决运维挑战。虽面临组织和技术难题,但紧密合作加强了平台,未来将扩展平台、迁移关键应用。
打造图像编辑领域的ImageNet?苹果用Nano Banana开源了一个超大数据集
苹果研究团队提出Pico - Banana - 400K数据集,基于Nano - Banana在OpenImages实拍照片生成编辑对。其系统化设计保证质量与多样性,还构建自我编辑评估流程,为图像编辑模型训练评测奠定基础。
八年后,Meta教会了Transformer「显式思考」
10月20日Meta上线新论文《The Free Transformer》,作者François重写Transformer思维方式,造出Free Transformer新架构。它在解码器内加入随机潜在变量,让模型生成内容前先‘思考’,实验显示在多任务上性能显著提升。
ACMMM 2025 | 北大团队提出 InteractMove:3D场景中人与可移动物体交互动作生成新框架
北大团队在ACMMM 2025发布InteractMove,首次提出含可移动物体3D场景中基于文本的人 - 物交互生成任务,构建数据集与创新框架,在多指标领先,代码与模型已开源。
吴恩达来信:Agentic编程与Agentic软件测试协同合作
在人工智能辅助编程时代,自主代理编程系统虽加快开发速度,但存在不稳定性。自主测试可对比代码与测试,对软件基础设施组件测试有益。吴恩达分享编程智能体问题及测试重点领域。
腾讯版“Claude Code”来了!AI编程L4时代is coming
9月9日腾讯发布AI CLI工具CodeBuddy Code,CodeBuddy IDE开启公测。它是腾讯版“Claude Code”,可自然语言驱动开发运维。随着AI编程发展,CLI成基础设施,CodeBuddy代表企业级AI编程新方向。