「编程任务」共找到 2878 篇相关文章
视频生成1.3B碾压14B、图像生成直逼GPT-4o!港科&快手开源测试时扩展新范式
香港科技大学联合快手可灵团队推出 EvoSearch 方法,支持图像和视频生成。该方法无需训练和梯度更新,能提升模型生成质量,展现了 test - time scaling 补充 training - time scaling 的潜力,目前论文和代码已开源。
模型不是企业的护城河,那什么才是?
文章指出企业AI进入深水区后,真正的竞争是将AI变成企业自己的智能引擎。衔远科技创始人周伯文提出泛化基础上的深度专业化是企业竞争力来源。衔远发布EnterpriseClawBench,揭示企业需私有化评估和可持续进化能力。
CVPR 2026|AI开始会拍电影了:一分钟十镜头,全程不崩剧情
多镜头视频生成要求模型处理不同镜头间稳定信息和变化信息,现有方法有局限。Meta与哥本哈根大学研究者提出OneStory,建立跨镜头记忆机制,设计关键模块,实验表现好,为视频生成打开新可能。
OpenClaw代码越改越崩?新研究EvoClaw揭示:Agents持续开发成功率仅13.37%
USC邓港大等联合发布评估基准EvoClaw,揭示AI在持续开发场景下表现不佳,成功率仅13.37%。研究还指出当前评测易高估AI能力,提出DeepCommit重构演进历史,分析各模型在持续演进中的局限与问题。
走出 MMLU 的高分幻觉:AI Agent 的「斯坦利时刻」与职场生存法则
文章指出多模态大模型在基准测试分数高,在实际业务流程却像‘职场巨婴’。研究团队构建Trainee - Bench测试顶尖模型,结果显示模型离‘独立上岗’远,凸显提升Agent自主学习性的重要性。
从需求分析到代码生成,LLM都能干点啥?一文读懂291个软工Benchmark!
大语言模型重塑软件工程各环节,但缺乏评估其在该领域表现的系统工具。浙江大学等机构团队首次对291个软件工程Benchmark系统综述,分析现状、痛点并给出改进方向。
通义实验室最新成果WebDancer:开启自主智能Deep Research的新时代
通义实验室推出 WebDancer,解决自主信息检索智能体构建难题。它创新合成训练数据,采用两阶段训练策略应对开放网络训练挑战,在多个基准测试中表现卓越,未来还将拓展能力。
首个多人对话视频生成框架MultiTalk,角色有表情还能互动
现有音频驱动人体动画方法多聚焦单人,处理多音频流能力弱、指令跟随有局限。中山大学提出多人对话视频生成新框架MultiTalk,介绍了技术原理,演示效果显示其指令跟随能力强、伪影少。
Sand.ai重磅更新MagiAttention,正在定义分布式Attention性能新标杆
2025年4月,Sand.ai开源MagiAttention v1.0.0。如今发布v1.1.0,适配Blackwell新架构,构建原生Group Collective原语,经系统级协同优化,在多模型训练中得到实证,展现卓越性能。
14.5K!冲上Github Trending榜,字节最新开源Agent上下文"数据库"!
OpenViking是字节跳动火山引擎开源的AI Agent上下文数据库。它用文件系统范式管理上下文,有分层加载、递归检索、可视化轨迹和自动会话管理等特性,支持多种模型,测试效果显著。