「自主智能测试」共找到 5106 篇相关文章
多模型共享 GPU 内存,Berkeley 开源新工具
GPU内存利用率低是大模型部署痛点,伯克利Sky Computing Lab团队开源kvcached工具,通过虚拟化技术让多模型共享显存。它引入虚拟内存概念,按需分配,测试显示能提升效率,安装简单、兼容性好。
0.5B以小搏大拿下端侧模型新SOTA:4090可跑,长文本处理5倍常规加速丨清华&面壁开源
清华大学和面壁智能团队开源MiniCPM 4,有8B、0.5B两种参数规模,以22%训练开销达同级别最优。它在架构、推理、数据、训练多方面创新,性能领先,适用于综述生成、工具调用等场景。
任何错误只犯一次:TencentDB Agent Memory 的团队记忆实践
文章聚焦 TencentDB Agent Memory 的团队记忆实践,从组织协作现状出发,阐述其原理、结构、构建方法,通过多方面测试验证其价值,提炼出设计原则,指出其核心是治理系统,目标是提升协作带宽。
端侧跑大模型,现在也太简单了
作者Vicki Boykis分享本地运行AI模型体验,指出如今本地模型性能提升大,像GPT - OSS、Gemma 4系列表现出色。还介绍运行本地智能体流程的设置,虽有问题,但优势多,生态值得投资。
模型都一样了,AI Agent 真正的差距在 Harness 层!
如今各平台接入模型趋同,AI Agent 差距体现在 Harness 层。以天工超级智能体为例,其有约束先行、任务并行编排等亮点,还提供 Skill 粒度新思路,且云端运行降低使用门槛。
告别“一眼定生死”:Agent-as-a-Judge 开启 AI 评估的下半场
过去两年,LLM-as-a-Judge成评估界“黄金标准”,但面对复杂任务力不从心。论文《A Survey on Agent-as-a-Judge》指出,应从单一的大模型裁判进化为具备行动能力的智能体裁判,还阐述了其优势、发展阶段等。
从过拟合到通用!ViMoGen开启3D人体动作生成新纪元
随着AIGC爆发,3D人体动作生成领域滞后,现有模型泛化能力有瓶颈。南洋理工大学等机构研究人员提出ViMoGen,从数据、模型、评估三方面重新定义通用动作生成路径,还能赋能具身智能。
GPT-5.2降智遭全网差评!奥特曼慌了
OpenAI推出GPT - 5.2,却未打赢谷歌。第三方数据显示Gemini 3 Pro更优,GPT - 5.2在多项基准测试表现不佳,可信度不如GPT - 5.1,遭开发者吐槽。OpenAI为此调整策略,但仍处被动。
OpenAI 盲测新模型不如 Nano Banana Pro?曝 Altman 要暂停 Sora,死磕 ChatGPT
近日,网友发现 Notion 或在测试 GPT - 5.2。OpenAI 盲测新图像模型‘Chestnut’和‘Hazelnut’,结果接近 Nano Banana Pro,但生成图未获好评。Altman 调整战略,暂停 Sora 死磕 ChatGPT,本周将推 GPT - 5.2。
ChatGPT缔造者联手DeepMind大神,用AI攻坚高温超导,半个硅谷抢着投
OpenAI前研究副总裁Liam Fedus与DeepMind材料科学领军者Ekin Cubuk共创Periodic Labs,以3亿美元种子融资走出隐身模式。他们要打造「AI科学家」,构建自主实验室,攻坚高温超导等难题,获众多资本青睐。