测试任务」共找到 3358 篇相关文章

新闻资讯7

突发!OpenAI停止强化学习训练两周

OpenAI发文称暂停最新模型强化学习训练两周,加固研究环境、进行红队测试等。部分低风险训练已恢复,最大规模前沿模型训练仍暂停。此举源于Hugging Face安全事故及Astra模型潜在风险。

机器之心
产品应用7

Karpathy头疼的“AI游戏困境”,被这款15分钟出包的国产神器破解了

8月初Andrej Karpathy指出通用AI做游戏时,LLM无法高效审查工作的弱点。而国产平台Spellcaster能先解析自然语言确定游戏设计,15分钟出包,还内置测试员验证,团队想工程化落地新方向。

AI寒武纪
产品应用7

深度体验DeepSeek Harness,我原谅它涨价了

本文深度体验了DeepSeek Harness,它已发布并开源代码。其一切如模型、工具等皆为可插拔积木,官方内置超百个插件。介绍了安装方法、使用特点,还对比了与Codex差异,认为它是Agent时代的安卓,有望推动自进化。

量子位
新闻资讯7

DeepSeek V4「满血版」曝光了!最快明天发布

全网等近三个月,DeepSeek V4正式版或最早明日发布。有Flash和Pro两版本,开发者评价其性能接近Opus 4.8,Agent能力增强。首轮测试外流,评价不一。还将引入「峰谷计费」,性价比仍高。

新智元
推荐文章7

翁荔最新博客:我们可能高估了模型,却严重低估了那层“脚手架”

前OpenAI安全研究副总裁翁荔在新博客聚焦AI领域Harness Engineering。她认为Harness是决定模型在现实任务中走多稳、多远的‘脚手架’,并梳理其演进路线,也指出研究面临评估、安全等瓶颈。

DeepTech深科技
算法论文7

ICML 2026|如何对Multi-Agent系统进行过程评估?重新认识多智能体系统中的Orchestrator

来自南京大学NLP实验室的ICML 2026论文指出,当前主流多智能体架构中,系统失败常源于负责全局调度的Orchestrator失去对任务的掌控。论文提出相关框架和方法对其进行分析与评估。

机器之心
新闻资讯7

30天烧掉60万亿,扎克伯格没进前250:大厂AI沦为KPI游戏

亚马逊、Meta等大厂流行用token摸鱼,员工为拉高榜单数字让AI跑不必要任务。Jellyfish数据显示烧10倍token仅换来2倍产出,成本飙升。这既扭曲生产力,又为资本开支背书。

新智元
推荐文章8

让AI Agent自动接Issue、写代码、上线:我用200行代码搭了一个全自动开发流水线

文章介绍AI Agent驱动的全自动开发流水线,对比传统流程,指出开发者角色转变。列举开源工具,给出200行代码的最小实现,分析半自动与全自动差异及信任鸿沟,点明开发自动化趋势,还给出落地建议。

AI Reading Hub
推荐文章8

Qoder Skills 完全指南:从零开始,让 AI 按你的标准执行

文章介绍Qoder Skills,它是强大AI定制方式,像菜谱让AI按标准执行。阐述本质、结构、原理,对比与其他工具差异,说明适用场景、安装方法,还有实战演示、编写规范、测试迭代及团队协作等内容。

阿里云开发者
算法论文8

AI「看不懂」、「做不好」视频的问题,混元用「MTSS」解决了

腾讯混元团队提出 Multi-Stream Scene Script(MTSS)新视频描述范式,将传统方式升级为‘多流结构化剧本’。它解决了传统方式语义冗余、扩展性差等问题,在视频理解和生成任务表现显著。

机器之心