「测试时间扩展」共找到 2429 篇相关文章
超越VLA与世界模型,银河通用发布LDA,全谱系数据跑通Scaling Law
近期具身智能领域竞争激烈,银河通用联合多机构发布 LDA-1B 模型,能统一利用各类具身数据。它在基准测试中表现出色,代码已开源,还解决了数据格式、质量等问题,实战效果也很突出。
GPT Image 2研究科学家陈博远:我在OpenAI修中文
GPT Image 2发布引发AI圈震动,主力训练者陈博远分享幕后故事。他和奥特曼同台主持,修好中文渲染,给模型起代号“布基胶带”,还设计多种“彩蛋级”测试,抖出官网图片幕后花絮。
你的「龙虾」真记得你吗?剑桥发布长期个性化记忆基准ATM-Bench
剑桥大学团队开源面向AI个人助理的长期记忆基准测试ATM - Bench,评估AI面对真实生活数据时能否「记住你」。实验结果不佳,专用和通用智能体系统准确率低,凸显长期个性化记忆问答难题。
Claude Agent Skills:从第一性原理深入剖析
本文深入剖析Claude的Agent Skills系统,它是基于提示的元工具架构,借助‘提示展开’与‘上下文改写’扩展大模型能力。文中以具体技能为例,介绍其机制、构建方法、编写规范及常见模式。
微软开源新版Phi-4:推理效率暴涨10倍,笔记本可运行
今天凌晨微软官网开源Phi - 4家族最新版Phi - 4 - mini - flash - reasoning,它参数小性能强,适合边缘设备。采用自研SambaY架构,推理效率涨10倍,延迟降2 - 3倍,多场景测试表现优异。
Jina 第4版:多模态向量检索,统一适配,挑战3大任务
Jina第4版基于Qwen2.5 - VL模型扩展,支持单向量和多向量输出。它经对比学习和任务特化训练,推理时可按需选LoRA适配器,能利用多模态处理能力优化不同任务性能。
GPT-4o连验证码都解不了??SOTA模型成功率仅40%
MetaAgentX团队推出Open CaptchaWorld平台,用于测试Agent解验证码能力。实测SOTA多模态模型成功率低,如GPT - 4o也被难住。该平台特点多样,揭示了当前Agent短板及模型设计新方向。
微软又搞大新闻:GitHub Copilot 开源,VS Code 要变天了。
微软官宣将把 GitHub Copilot Chat 扩展代码开源,重构相关组件到 VS Code 核心,使其成开源 AI 编辑器。还推出 Coding Agent,能自动化处理多种开发任务,目前在 Copilot Pro Plus 版本预览。
ICML 2026|让AI自动发现前沿风险:创智×复旦×牛津发布AutoControl-Arena
当AI智能体走向真实应用,前沿风险藏于复杂长尾场景,难以靠人工覆盖。创智、复旦、牛津联合发布AutoControl Arena框架,自动合成可执行测试环境,还构建X - BENCH验证,已在GitHub开源。
Cursor 终于让你可以关笔记本了
昨夜,AI编程工具Cursor发布Agent云功能更新,解决本地运行占资源问题。可本地云端无缝切换,10分钟搭云端开发环境,有独立云子Agent隔离任务,iOS测试版上线,获用户认可。