「编程能力评估」共找到 4504 篇相关文章
「边思考、边搜索、边写作」WebThinker开启AI搜索&研究新纪元!
大型推理模型有推理能力,但静态知识限制其在复杂任务表现。WebThinker 让 LRM 推理中自主搜索、导航及写报告,集成探索器,有自主策略和训练工具,实验显示性能强,还指明未来探索方向。
协和4+4的另一面:浙江范式用AI定义医疗未来!AI「智愈」时代来临
一场关于协和“4+4”的热议引发医疗未来之问,浙江从医院、企业、政府三重维度,以浙大二院、德适生物、安诊儿等为例,展示AI在医疗领域的应用,构建未来医疗图景,推动医疗从“治病”走向“智愈”。
1000 万悬赏生活类智能体!支付宝正亲手把未来 10 年的商业入口交给独立开发者
本文报道支付宝在2026外滩大会宣布,每年投入1000万元设立「智能体涌现奖」悬赏生活类AI智能体,开放自身支付、流量、风控等生态能力,助力独立开发者落地真实需求、实现商业闭环,抢滩智能体商业新入口。
基础杂活全被一键秒杀,还要初级员工干嘛?Google Research负责人:以往熬15年的判断力,现在一出道就得硬抗
本文为Google Research全球研发副总裁Yossi Matias的官方播客访谈,分享了Google在生成式AI、AI加速科研、行星级智能、量子计算等前沿方向的探索,探讨AI替代基础工作后对人才能力要求的变革。
狂裁70%工程师指望AI顶上?Android之神算了一笔账:补贴一旦退潮,AI账单直接贵过程序员
本文是Android知名开发者Jake Wharton的深度访谈,他经历行业裁员后明确拒绝AI相关工作,针对企业用AI取代工程师裁员算了成本账,同时分享了对Kotlin发展、编程语言、开源生态的观点,干货十足观点犀利。
Axiom Math 对谈 SGLang:模型的下一步是可验证,结果层才是真正的护城河
在AGI Playground 2026圆桌论坛,Axiom Math联合创始人等探讨AI核心问题。提到AI进入生产环境,可验证或成瓶颈,还从长任务智能体、推理基建等多方面深入交流,如模型验证、基建优化等。
Gemini 3.8,明日登场!
最新爆料,Gemini 3.8 Flash明日登场,谷歌已放弃Gemini 3.5 Pro。其编程实力强悍,之前还为Gemini植入智能体视频理解功能,降本提效,可应对多种高难度场景。近期多家AI发布计划撞车,混战升级。
上周 GPT 和 Codex 各有一个发布,很多人没注意吗?可以解锁 Codex 百万上下文了
最近基模发布多,OpenAI 俩更新被低估忽略。一是 GPT - 5.6 Sol 的 Ultrafast 模式,输出最高达每秒 750 Token,先向少量 API 客户开放;二是 Codex 为其开放百万上下文能力,不过大窗口有代价。
SeeDance 2.5:AI 一次能出 30 秒视频,被重新定价的是这几层人
7 月初,字节在火山引擎 FORCE 大会上放出 SeeDance 2.5,它能一次性生成 30 秒完整成片。文章详述其能力,提出视频生成的不可能三角判断框架,还分析它会重新定价产业链上多个环节,改写产出随机性。
一篇Loop+Harness的自进化Agent最新综述
本文分享清华关于经验时代,已部署的 Agent 如何将交互轨迹转化为持久能力,从自我进化到元进化的论文。介绍了 Harness、技能、记忆、环境等方面,还提及 RL 与持续学习、元进化智能体等内容。