生成式任务」共找到 4239 篇相关文章

开源动态8

大模型首次直接理解代码图:不用Agent自动修bug,登顶SWE-Bench开源模型榜单

蚂蚁开源新模型CGM,首创将仓库代码图模态融入大模型,不依赖闭源模型和复杂Agent,仅需4步就能快速定位、生成补丁。它在多个测试基准中领先,技术论文等均已开源。

量子位
算法论文8

RL救不了泛化性!揭示LLM数学Reasoning的深层瓶颈

大型语言模型在数学竞赛级任务依赖机械化推理,现有评测集有缺陷。UC Berkeley团队提出OMEGA基准量化其数学泛化能力,实验揭示复杂度引发性能崩塌等问题,指出LLM创新组合难,给出改进方向。

深度学习自然语言处理
开源动态8

LeCun世界模型出2代了!62小时搞定机器人训练,开启物理推理新时代

Meta开源发布V-JEPA 2世界模型,图灵奖得主Yann LeCun称其将为机器人技术带来新时代。该模型能理解物理世界,经训练后在多方面表现优异,Meta还发布新基准测试,也透露了后续计划。

量子位
算法论文8

最大的开源GraphRag:知识图谱完全自主构建|港科大&华为

香港科技大学KnowComp实验室与香港华为理论部提出AutoSchemaKG框架,可自主构建知识图谱,无需预定义模。该系统利用大模型提取知识三元组并归纳模,构建了ATLAS系列知识图谱,经测试表现优异。

量子位
算法论文8

大模型Agent的下一阶段:可自我进化的AI-Agent

在人工智能飞速发展下,研究者探索让AI自我反思改进。本文作者构建自我进化AI智能体系统,设计四层渐进架构,经《卡坦岛》实验,证明自我进化能力,不同模型表现有差异,代码级进化潜力惊人。

AINLPer
产品应用7

作业帮基础观测能力之一监控体系实践

本文介绍作业帮监控体系实践。其监控体系随云原生成长,支持全集群监控。构建时选 Prometheus 采集、VictoriaMetrics 存储,还从多维度采集指标,用自研代理降成本、治理指标,让系统更贴合研发。

InfoQ
算法论文8

ACL 2025 | 清华&港中文提出 MorphMark:全新理论视角破解大模型水印效力与文本质量的两难困境

随着大模型广泛应用,AI 生成内容追溯和版权保护成问题,现有水印技术面临效力与文本质量的矛盾。清华和港中文团队提出 MorphMark 自适应水印框架,动态调强度,在多模型实验中表现优。

深度学习自然语言处理
产品应用9

不踩点不微调!Figure最新模型盲测30个家庭:首次实现零样本全身泛化

人形机器人公司Figure发布最新端到端具身模型Helix 2.5,在30套未采集训练数据的陌生住宅开展全盲家务测试,验证Index预训练可让模型实现零样本全身泛化,整体成功率56%,远高于对照组的9%,证明人形机器人跨场景迁移的工程可行性。

AI前线
产品应用7

“美国大豆包”Gemini翻身:输出速度碾压同行、智能水平重回第一梯队

过去 Gemini 被吐槽,如今 Google 推出 Gemini 3.8 Flash,六周内第三款 Flash、四个月内第四次更新。新模型成绩佳,输出快,成本低,智能体评测进步大,从经济型选项成生产主力,但实际表现待检验。

InfoQ
产品应用7

用Codex做跨境电商:第九章

文章讲述用Codex做跨境电商时,五条工作流跑通后业务仍会遇问题,而业务系统能让前后任务相连。其是持续经营机制,通过五步让本周之事影响下周做法,还结合案例说明如何操作。

newtype AI