「代码可执行性」共找到 2117 篇相关文章
豪掷30亿美元,OpenAI史上最大收购案!
彭博爆料OpenAI将豪掷30亿美元吞并AI编程工具Windsurf,这是其史上最大规模收购。Windsurf因模型无关性设计等优势脱颖而出,此次收购或重塑AI编程市场格局。
Lex Fridman 对话 DHH:Omarchy,才是真正属于 Agent 时代的操作系统
Omarchy 有望成今年最火 Linux 桌面系统、首个 Agent 时代操作系统。开发者 DHH 曾怀疑 Agent 编程,现 Quattro 代码全由 Agent 编写。DHH 做客播客,谈 Omarchy、AI 时代操作系统变化等。
华师大智金院孵化金融原生基模Mint-Agent:超越GPT-5.6与Claude Opus 4.8,商业订单已超亿元
华东师大智金院团队孵化的金融原生基模 Mint - Agent 发布,在 FinanceAgentBench v2 上表现超 GPT - 5.6 - Sol 与 Claude Opus 4.8,单题推理成本低,商业订单超亿元,进入规模化金融场景验证阶段。
Auto-Research「终极大考」:新基准撕下大模型科研伪装
来自多所高校的研究者提出MLS - Bench,用于解决现有Auto - Research评测的归因问题。它含140个真实研究任务,校准受控修改范围,主实验显示当前模型在方法发现上有明显缺口,Auto - Research需更严格评测标准。
泪崩!!!完啦,完啦 AI 编程,4k Star MonkeyCode!!!
现在很多AI编程工具,只让Agent“写出代码”。而MonkeyCode把AI编程任务接入完整链路,是面向专业研发团队的开源AI开发平台,本文介绍其特点、适用场景及注意事项。
竞赛编程Agent进入全球前十!南大、清华新模型CF rating超3500
大语言模型在竞赛编程场景易失败。南大、清华等研究者提出Solvita框架,由四个角色形成闭环,构建可训练图结构知识网络积累经验。实验显示其在多评测中表现强,提升不靠增加token。
邢波再出手:上次「骂」完世界模型,这次轮到智能体了
邢波教授新作《智能体模型批评》上线 arXiv,质疑当下被称为「智能体」的系统是否名副其实。论文将其分为两类,沿五维度拆解主流设计,提出 GIC 架构,还探讨了安全问题,指出要让能力内化进模型。
Headroom:Netflix 工程师开源的上下文压缩工具,省 token 还是烧 token?
Netflix工程师Tejas Chopra开源Headroom,定位为AI Agent的上下文压缩层,压缩工具输出等内容,有可逆压缩等特性。官方数据显示节省token效果好,但微软工程师实测结果中性偏负面。
Claude Code 修了几个小 bug,却揭开了 Agent 落地的大麻烦
Anthropic给Claude Code发的更新,看似是修小bug,实则指向AI编程产品正从“模型会不会写代码”转向“Agent能否稳定完成任务”,暴露了工具状态、权限边界等执行问题。
堆了一仓库GPU,却生产不出专业智能?九章云极用AI工厂给出解答
企业接入通用大模型到业务系统,却发现它难以执行任务。九章云极在发布会上推出‘AI工厂’战略,通过训练工厂和Token工厂填平执行鸿沟,前者用强化学习造专业模型,后者让专业智能规模化流通。