「黑盒测试框架」共找到 3162 篇相关文章
从静态模型到数字生命体:自进化AI Agent综述
近年大型语言模型催生AI智能体发展,但现有系统依赖人工预设,难适应动态环境。论文提出自进化AI智能体,可通过环境反馈自动优化,还提出三定律、四阶段范式演进模型等,开源EvoAgentX框架。
一个半月高强度 Claude Code :Vibe coding 是一种全新的思维模式
开发者王巍记录使用Claude Code感受与经验。提到Vibe coding是新思维模式,还分享从传统Editor AI转换的体验,以及CC的边界、使用模式、迭代方式等,也谈到其限制与应对策略。
奥特曼深夜官宣:OpenAI重回开源!两大推理模型追平o4-mini,号称世界最强
OpenAI深夜推出gpt-oss 20B和120B两款开源模型,性能比肩o3-mini和o4-mini,能在消费级显卡甚至手机运行。有宽松许可证等亮点,还准备了体验网站。这是自GPT - 2后首次开源,降低了部分群体准入门槛。
全球首个人形机器人通用视觉感知系统,Humanoid Occupancy建立多模态环境理解新范式
北京人形机器人创新中心推出 Humanoid Occupancy 感知系统,创新性融合多模态传感器信息,构建通用感知框架。它以语义占用表征为核心,有全编码和适配融合优势,经实验验证性能优,推动机器人迈向通用感知时代。
全球首个全链式空间天气AI预报模型“风宇”!国家卫星气象中心牵头,联合南昌大学、华为共同研发
当前太阳活动高发,传统空间天气预报难满足需求。2025年7月26日,国家卫星气象中心牵头联合研发的“风宇”模型发布,它是全球首个全链式空间天气AI预报模型,提升了我国空间天气预报能力。
「All in AI」的 Shopify,分享了他们的全员 AI 落地实践,全是干货
Shopify 三个月前决定「All in AI」,副总裁 Thawar 分享公司引入 AI 的策略、提升效果与三个「反直觉」见解。如全员无差别用 AI、让 AI 展示思考过程、重视新手等,还给出多个工作流案例。
重塑注意力机制:GTA登场,KV缓存缩减70%、计算量削减62.5%
GTA由多所高校联合研发,提出大模型框架,解决传统多头注意力机制弊端。通过分组共享注意力矩阵和压缩潜在值表示,削减计算量、缩减KV缓存,实验验证其性能优、效率高,虽有局限但前景好。
LiteReality来了!用一张扫描图还原真实3D世界
剑桥大学提出 LiteReality,可将室内 RGB - D 扫描数据转为 3D 虚拟副本,支持多种图形渲染功能,适用于多领域。它通过多步骤流程重建场景,还引入新框架解决材质恢复问题,但也存在依赖人工等局限。
百度开源文心4.5系列10款模型,多项评测结果超DeepSeek-V3
今日百度正式开源文心大模型4.5系列10款模型,涵盖不同参数规模。该系列模型在多文本和多模态基准测试达SOTA,多项评测超Qwen3、DeepSeek - V3,还具备三大关键创新,获开发者关注。
苹果一口咬死AI不会思考!OpenAI前高管直接开怼:AGI已来,别再酸了
苹果论文《思考的错觉》挑战AI推理能力基本假设,引发争议。OpenAI前研究主管则称AGI时代已近。多项研究测试推理模型,指出其有进步也有瓶颈,未来或需换思路,评估方式也待完善。