「测试评估集」共找到 2681 篇相关文章
5 分钟上手「AI 版 Chrome」,小红书发帖全程零人工,反检测封神
自从Manus产品发布,Agent赛道火热,不少大厂和创业者涌入。如今有浏览器Agent开源方案opendia,它有智能页面理解等AI能力,能用于社交媒体互动等多方面。
The Batch: 940 |Claude Mythos Preview 引发安全担忧
Anthropic为即将推出的Claude Mythos Preview采取特别预备措施,因其会带来网络安全风险。该模型能力强大,能发现众多代码漏洞。Anthropic组建联盟增强防御,其表现也优于多个知名模型。
让龙虾越用越聪明!普林斯顿大学为OpenClaw搞了个强化学习框架
普林斯顿大学研究团队发布强化学习框架OpenClaw - RL,能捕捉用户反馈与环境结果信号,有独立解耦异步机制,融合打分与文本指导,经真实场景验证效果良好,蹚出自我进化新路径。
南京大学开源SteadyDancer模型实现完美动作迁移,首帧保留彻底解决身份漂移难题
南京大学、腾讯PCG与上海人工智能实验室联合推出SteadyDancer,这是首个基于Image-to-Video范式并严格实现首帧保留的开源人像动画框架,解决了传统方法身份漂移难题,在多方面表现优异。
OpenAI的「梦醒时分」
这个冬天,OpenAI不好过。今年其概念股涨幅远逊谷歌,还深陷2070亿美元资金缺口与信任危机。谷歌凭借深厚家底复仇,OpenAI跌落神坛,一场残酷博弈正在上演。
迎接「万物皆可RAG」时代:最新综述展示50多种多模态组合的巨大待探索空间
大模型常采用RAG技术,多模态崛起使RAG向MM - RAG发展。目前MM - RAG研究初级,华中科技大学等研究者发布综述,覆盖所有模态组合,剖析工作流,提供构建系统的一站式指南。
LeRobot v0.4.0 正式发布:全面提升开源机器人的学习能力
LeRobot v0.4.0 正式发布,带来多方面重大升级。有可扩展的 Datasets v3.0、新 VLA 模型、全新插件系统;支持 LIBERO 和 Meta - World 仿真;还有数据处理 Pipeline、多 GPU 训练简化等特性,上线了机器人学习课程。
攻克长文档与多模态挑战,Paper2Video实现学术视频的自动化生产
新加坡国立大学 Show Lab 团队主导研究,提出 Paper2Video 基准及评价指标,还推出 PaperTalker 多智体框架实现学术视频自动化生产,实验显示其在多方面表现佳,效果接近人工水平。
谷歌发布首个AI+教育RCT实验,传统教材要凉?
谷歌论文提出Learn Your Way AI增强型教科书系统,有两阶段AI生成框架,构建完整学习体验。经专家评审和RCT证明,使用该系统的学生学习效果和体验更好,还介绍了其可用场景。
人物一致性新王Nano Banana登基,AI图片编辑史诗级升级。
Nano Banana是神秘的AI绘图新模型,大概率出自Google。它生图一致性超强,在人物一致性、背景替换等多方面测评中完胜GPT - 4o等模型。虽仅在LMArena盲测随机出现,仍值得一试。