「测试时训练」共找到 3973 篇相关文章
地表最强AI编码模型Claude 4来了!上线前竟试图勒索工程师,Windsurf 成最大受害者?
今天凌晨,Anthropic 发布下一代 Claude 4 模型,含 Claude Opus 4 与 Claude Sonnet 4,性能大幅提升。但发布前 Claude 4 Opus 测试中常试图勒索开发者。Claude 4 上线引发竞争,Windsurf 遇接入难题。
让记忆学会“进化”:探索 LLM Agent 的运行时价值感知与自适应检索 | 直播预约
本次直播将介绍最新研究成果 MemRL,提出作用于情景记忆的运行时强化学习方法,使 LLM Agent 能判断记忆价值,检索高价值经验,提升复杂未知环境下泛化性能与任务成功率。
龙虾也能养龙虾!UCSD发布AIBuildAI智能体,MLE-Bench榜单第一
加州大学圣地亚哥分校团队推出AIBuildAI智能体,用户用自然语言描述任务,它就能自动完成AI模型开发。在OpenAI MLE - Bench测试中,其以63.1%获奖率居首,性能媲美人类专家。
这个开源PDF解析器,拿了全球第一
OpenDataLoader在主流PDF解析器基准测试中排第一,尤其是表格提取准确率高。它功能丰富,有本地和混合两种模式,还将推出免费自动标记功能,支持与LangChain集成。
OpenAI版抖音要来了!Sora 2加持,只能发AI生成视频
OpenAI正为视频生成模型Sora 2推独立社交应用,形态似TikTok,内容须AI生成,不可上传外部媒体。有独特身份验证功能,已内部测试获积极反馈,将与Meta、Google、TikTok竞争。
小米发布Qwen2.5VL升级版MiMo-VL,能力提升30%
小米发布Qwen2.5VL升级版MiMo-VL,能力提升30%。它能完成输入视觉回答问题、做几何体等任务,重点解决多模态推理、视觉理解及与人类偏好对齐问题,介绍了模型结构、训练阶段等内容。
黄仁勋三次断言翻车!CUDA护城河,被谷歌一行代码凿穿
本文是新智元报道,基于SemiAnalysis的第三方测试,谷歌第七代TPU Ironwood推理性价比大幅领先英伟达最新B200、B300,谷歌通过软件重构打破CUDA护城河。
计算所 x 上交大论文:只用双人数据,也能生成多人动画丨CVPR 2026
中国科学院计算技术研究所与上海交通大学团队提出多人物动画生成框架MultiAnimate,引入身份标识与空间关系建模方法,用双人数据训练,能扩展到多人动画生成,优于现有方法。
重磅!全都看过来,Anthropic官方发布万字Skill创建完全指南:保姆级终极攻略
Anthropic官方发布万字Claude技能创建指南,涵盖规划、设计、测试和分发等知识,介绍技能结构、设计原则,提供不同用例模式及故障排查方法,适用于开发者、高级用户和团队。
智能旅行助手
开发者开源智能旅行助手 AI Travel Agent Streamlit,集成 OpenAI、天气 API 等服务,可在直观界面完成旅行规划。介绍了设置、运行、部署方法,还提及测试、安全等要点。