「自主智能测试」共找到 5068 篇相关文章
震撼!0人类,16个Claude全自主开发,2万美元十万行代码成功运行Linux
Anthropic研究员用Claude Opus 4.6智能体团队自主编写超十万行代码的C语言编译器,能运行《毁灭战士》、编译Linux内核。团队用拉夫循环等机制让Claude自主开发,虽有局限但全自动软件开发时代已提前降临。
DeepRare 重磅发布:全球首个可循证智能体诊断系统,直击医学Last Exam难题
上海交通大学人工智能学院等联合发布全球首个罕见病推理型智能体诊断系统DeepRare。它结合大模型和多智能体架构,模拟医生诊断思维,支持多模态输入,在多数据集评估中表现出色,已上线在线平台。
为AI智能体选型、验收、优化提供量化依据:首部评估标准公开征集中
AI智能体成2025年十大战略技术趋势之首,到2028年至少15%日常工作决策将由其自主做出。但企业面临信任鸿沟,缺乏评估规范。首部聚焦AI智能体应用的团体标准公开征集起草单位与起草人,适用于多方,有核心内容与价值。
卡帕西630行代码炸出81个智能体,4天协作跑2333次实验,公布预训练十大发现
Karpathy的Autoresearch项目630行代码让AI自主实验,提升语言模型训练效率。全球开发者让多智能体协作,智能体自发形成同行评审制度。项目发起者公布十大发现,还衍生出表现出色的auto - discovery项目。
5Y News|微分智飞连续完成PreA & PreA+轮融资,加速飞行具身智能领域技术布局
近日,微分智飞连续完成PreA轮和PreA+轮融资,总金额近两亿。该公司成立于2024年具身智能兴起之际,依托四大核心技术打造飞行具身大脑及群体智能系统,其产品已在多行业应用,还在前沿技术有突破。
破解「长程智能体」RL训练难题,腾讯提出RLVMR框架,让7B模型「思考」比肩GPT-4o
腾讯混元AI数字人团队提出RLVMR框架,将‘元认知’理论引入RL,通过奖励‘好的思考过程’解决长程任务中智能体的低效探索与泛化难题,经其训练的7B模型表现出色。
The Batch: 922 | 面向智能体的管理系统
OpenAI 发布 Frontier 平台,用于编排和管理企业级 AI 智能体团队。它支持智能体构建、信息共享等,Cisco 等已试点,未来将更广泛开放。与 Microsoft 的 Agent 365 有不同侧重,企业对智能体集中管理需求渐显。
美团王兴,中国具身智能第一投资人
美团王兴是具身智能融资大潮中低调又凶猛的棋手。2025年7月,美团已出手2家具身智能公司,2023年至今旗下基金出手8次,投7家相关公司。王兴以投资人角色成中国具身智能机器人投资第一人。
走出屏幕,多模态智能硬件如何承载最新的 AI?
多模态模型推动人工智能向现实渗透,多模态智能硬件形态更多样。不同阵营玩家在这一热门赛道竞争,AI手机、机器人、智能眼镜等受关注,近半年还有新型精细形态智能硬件涌现。
具身智能的第四阶段:「造系统」?
进入2026年下半年,业内形成共识:具身智能竞争从单一模型比拼转向系统工程与产业基础设施角逐。鹿明机器人推出具身智能开发与验证平台Lumos Station Lite,提出“产业具身”理念,助力具身智能落地。