「编程能力评估」共找到 4438 篇相关文章
性能提升11.74%!腾讯优图提出激励推理,专攻复杂指令
现有大语言模型处理复杂指令能力不足,腾讯优图研究团队提出激励推理方法。该方法能提升LLM处理复杂指令表现,在1.5B参数LLM上性能提升11.74%,媲美8B参数模型。
Anthropic 联创:2028 年实现 AI 自我构建的概率超过 60%
Anthropic 联合创始人 Jack Clark 发长文称,到 2028 年底,AI 实现端到端自动化研发概率超 60%。他分析多维度测试数据,指出 AI 在代码、科研、自我训练和管理等方面能力提升,也探讨了成真后的影响,但遭黄仁勋和陶哲轩质疑。
陶哲轩ICM 2026:数学界迎来「百年新危机」,AI狂飙逼迫全行业重写游戏规则
7月24日,陶哲轩在ICM 2026演讲指出数学界正经历新危机,关乎价值观与工作方式。他围绕AI能力猜想探讨数学界如何应对,列举目标和风险,提出需升级目标,还介绍莱顿宣言建议。
真正能用好AI的企业是怎么做的?(附企业级AI落地实战手册)
数字化深入,非结构化文档成企业难题。合合信息发布白皮书,提出复杂文本智能五大核心能力标准,用11个行业标杆案例展示多模态文本智能技术应用,提供可复制落地范本。
22.4K Star!这个开源 AI 工具给 Agent 装上「项目经理大脑」!
GitHub上项目Beads登上Trending榜单,它是为AI编程助手设计的分布式任务追踪系统,底层基于Dolt数据库,解决多AI协作痛点,有版本控制、AI优化等亮点,还提供多种安装方式。
近期,不错的LLM Agent统一记忆框架综述~
随着GPT、Qwen、Claude等大模型能力提升,LLM-based Agent走向长期任务。论文提出统一框架拆解Agent Memory为四组件,围绕两个数据集复现比较10个方法,还设计出新的低token开销框架。
谷歌机器人大脑又进化了。成功率飙3倍,还能看表干活、保护自己
Google DeepMind发布机器人大脑Gemini Robotics ER 1.6模型,提升机器人空间感知、多视角解析与仪表读取准度,具精准指认、读表能力,还提高操作安全性与合规度,开发者可通过Gemini API等使用。
让AI自我进化?斯坦福华人博士答辩视频火了,庞若鸣参与评审
斯坦福大学博士生 Zitong Yang 完成「持续自我提升式 AI」博士论文答辩并分享视频。他针对当前模型局限提出解决方案,涵盖合成持续训练、预训练能力自我提升、迈向 AI 设计 AI 三个核心方向,引发行业关注。
Gemini 3「开眼」像素级操控!谷歌回应DeepSeek-OCR2
Google DeepMind为Gemini 3 Flash推出Agentic Vision,让模型主动编代码操控图像,性能提升5% - 10%。该能力已上线,谷歌还计划扩展功能。这或许是受DeepSeek-OCR2刺激,两者技术路线不同。
猎头黄仁勋的2025:高管从巨头挖,干活钟爱华人创业团队
2025年英伟达在黄仁勋带领下,通过“黄氏挖人+黄氏收购”重塑“第二增长曲线”。一方面从谷歌、微软等巨头挖高管,补齐关键能力;另一方面收购初创公司吸纳核心团队与技术,多来自华人创业者。