「编程Agent评测」共找到 4017 篇相关文章
陶哲轩在菲尔兹颁奖现场:数学迎来百年新危机
菲尔兹奖得主陶哲轩在ICM大会称数学迎来百年危机,上次危机是检查逻辑地基,这次是价值观地基。他以First Proof评测展示AI解数学题能力,提出“工作假设”分析数学研究目标及KPI变化和“证明过剩”问题,还给出应对之策。
全民拜龙?我看是大厂“套壳大战”搞疯了
OpenClaw是开源AI Agent框架,引发全民热潮,中国大厂纷纷推出套壳产品。国产套壳产品上手难度低,但也存在问题。傅盛基于此养出AI团队,猎豹移动市值涨24%。不过,OpenClaw存在安全问题,背后是Token入口争夺战。
ICLR 2026 | 越推越快! 首个面向「Test-Time Scaling」的投机解码基准
文章指出推理阶段扩展(TTS)能提升推理大模型解决复杂问题的能力,但会产生大量冗余计算。为此提出首个面向TTS的投机解码加速综合基准,评测显示N - gram方法在特定场景加速潜力大,混合策略性能更优。
亚马逊码农噩梦来袭!沦落「仓库工人」,每天流水线分拣「AI代码」
AI工具广泛引入亚马逊编程工作,虽提升效率,但让程序员工作节奏变快,像流水线工人。亚马逊管理层推崇AI,认为能降成本提效率,可程序员担心创造力被扼杀、职业发展受影响。此外,实验显示AI编码助手能提升开发人员效率。
我用“悟空”做了应聘和OPT Skills,预测上班和创业成功率丨龙虾OPT创业笔记
钉钉发布全球首个企业级 Agent 平台“悟空”,它是AI产品进入下一个时代的探索,能接入多平台真实数据,操作公司流程。通过开发者应聘、跨境电商、知识博主等场景案例,展现其能力,还能预测创业成功率,解决企业使用AI的安全痛点。
用系统架构思维,告别“意大利面条式”系统提示词
本文作者分享编写系统级提示词经历,指出‘规则清单式’设计有规则打架、维护难、价值稀释问题。引入系统架构思维,构建四层设计框架,给出编译原则与模板,还重构‘AI编程助手’提示词,实现从‘规则管理者’到‘系统设计师’转变。
在三张圆明园鼠首照片里,我们看到了3D AI的Harness时刻
作者通过三张圆明园鼠首照片开展实测,验证了全新3D AI Harness工作流:通用Agent调度任务、专业3D模型生成、专业软件后处理,仅1.47元即可生成可编辑可交付的3D资产,探讨了3D AI行业的新发展路径。
Claude有意识了?科学家首次挖出关键拼图,还能伸手改它的念头
本文报道Anthropic最新研究,团队在Claude大模型中发现自发形成的J-space区域,匹配意识研究的全局工作空间理论,人类可直接读取、修改AI未输出的内部想法,揭示了现有AI对齐评测的重大漏洞,为AI意识研究提供了工程化路径。
刚刚,神话级Fable 5.1来了!
今天,Claude Fable 5.1全平台上线,Mythos 5.1专供特定团队。新模型跑分有断层式代差,还降低了算力门槛。通过重绘金星、设计蛋白等案例展示其科研能力,在编程上也表现出色,同时在安全上采取‘一松一紧’策略。
一个Skill让DeepSeek V4 Pro超越Fable 5?热门插件被锤了
前两天J-Space凭夸张测试结果刷屏,宣称一份Skill接入Agent环境,能让V4 Pro在多基准大幅提升,部分成绩超Fable 5。但社区复测结果相反,作者未公开完整评测记录,还删质疑帖,引发公开打假。