「开放式任务」共找到 1973 篇相关文章
Meta-Harness:让AI 改进自己的Harness
斯坦福IRIS实验室Yoonho Lee团队推出开源框架Meta - Harness,让AI自我优化流程。它像给AI用的‘时间机器’,记录源代码、执行轨迹和评估分数。在任务上表现出色,但也面临耗时、数据爆炸等挑战。
开源模型首超Opus4.6!智谱GLM-5.1登场,14小时后CUDA专家被冲了
智谱开源模型GLM - 5.1带来重大突破,14小时完成CUDA Kernel优化,加速比大幅提升。它解锁与顶尖闭源模型Claude Opus 4.6全面对齐,在多测试中表现优异,展现长程任务能力,改写行业叙事逻辑。
你敢把「龙虾」放在手机上跑吗?手机 Agent 离落地还差一道「隐私关」
港中深联合腾讯混元研究揭示,手机 Agent 落地关键不在成功率,而在隐私边界。研究设计隐私交互协议,构建模拟 App 记录过程,将常见越界行为归类检查,评估多个模型发现诸多隐私问题。
阿里“悟空”上线!钉钉给企业送来龙虾大军
AI钉钉2.0年度新品发布会上,阿里发布AI toB旗舰应用“悟空WuKong”,它以企业智能体为核心,能落地办公场景。悟空开启全球邀测,也会内置到钉钉AI 2.0。它还带来行业解决方案,补齐安全短板。
500行极简开源框架,硬刚GPT/Gemini视觉极限!
多模态大模型代码能力进步大,但基础视觉任务常失误。UniPat AI构建SWE-Vision框架,让模型用代码处理视觉判断,在五个视觉基准测试达最优,其极简设计有效且泛化性强,代码已开源。
刚刚,GPT-5.4 发布,百万上下文、最强全能模型
OpenAI发布GPT - 5.4,集推理、编程等能力于一体,支持百万级上下文窗口。有三个版本,功能全面升级,如支持中途打断、电脑操作、视觉能力提升等,还更省token、少幻觉,安全机制完善,价格有调整。
32B逆袭GPT-5.2:首个端到端GPU编程智能体框架StitchCUDA问世
现有LLM自动化CUDA方法难处理端到端GPU程序,StitchCUDA提出多智能体框架+基于Rubric Reward的Agentic RL方案,分解任务、优化训练,在实验中成功率和加速比远超其他方法,解决Reward Hacking问题。
AI参与战争的时代正式拉开帷幕?
美以对伊朗军事行动或已运用AI,美军投入大量资金研发相关技术,并通过实战迭代提升AI定点清除成功率。AI在军事中有多方面应用,美国已启动相关计划,引发全球军备竞赛,中国应迎头赶上。
Cursor押注云端Agent!CEO 放话:审核AI代码是开发者最核心竞争力
Cursor CEO 称 AI 编程进入第三时代,智能体可少人工介入完成复杂任务,开发者角色转变。Cursor 团队超三分之一 PR 由云端智能体生成,不过这引发了开发者对代码审查、工作流、安全等问题的讨论。
Vibe Coding 在代码生成与协作中的实践与思考
本文整理自阿里专家向邦宇的分享。探讨构建 Vibe Coding 工具,介绍其分类、在阿里现状。指出用户使用中面临代码质量等问题,产品自身有设计、安全挑战。还分享 Agent 建设经验,强调适配国产模型及模板化的作用。