「功能测试」共找到 3131 篇相关文章
姚顺雨署名:大模型「现学现卖」能力首次被系统评估,腾讯、复旦联手发布CL-Bench
腾讯混元团队和复旦大学研究人员联手推出全新基准测试CL - Bench,系统性评估大模型上下文学习能力。测试显示十大前沿模型表现不佳,揭示当前大模型在该能力上的普遍短板,并指出未来四个探索方向。
喂给AI的Skill正让它变笨!清华团队发现大模型经验复用的黄金法则
清华大学与EvoMap团队研究发现,给大模型提供详尽纠错Skill会使基准测试通过率下跌,而精简控制指令可提升性能。他们提出将程序化Skill转化为策略基因,经实验证实其更适合驱动智能体测试时演化。
字节悄咪咪上线了 AI 版抖音「随变」,在下什么棋?
临近春节,字节跳动 1 月初上线的「随变」App 在年轻人中流行。它类似「纯净版」AI 抖音,核心功能有 AI 形象生成等。字节借此在小体量社区验证功能,解决抖音年轻用户留存问题,也想抢占 AI 视频市场。
BesiegeField:LLM能否学会设计机器?
香港中文大学推出基于游戏《Besiege》的测试平台BesiegeField,探讨LLM能否学会设计机器。研究通过组合式机器设计视角,测试LLM,提出多智能体迭代设计流程等,发现LLM有挑战但并非不可实现,如Gemini 2.5 Pro表现不错。
马斯克吹牛了吗?Grok 4第一波实测出炉:既能完虐o3,也菜到数不清6根手指
马斯克称Grok在各学科达博士后水平,激起网友兴趣。博主测试显示Grok 4在多项测试中完胜o3,网友还用它写游戏、让概念可视化。不过Grok 4也有翻车表现,马斯克称其仍有改进空间。
登顶TPC-C!数据库分布式扩展技术揭秘
阿里云PolarDB云原生数据库以超原记录2.5倍性能登顶TPC - C基准测试排行榜。本文揭秘PolarDB MySQL版多主集群(Limitless)架构与核心技术,还介绍高可用机制、性能测试结果,最后提及轻量版和列存索引应用。
马斯克还在卷10秒,中国AI直接掀桌!16秒一镜到底,全球唯二
2026年AI视频圈竞争激烈,硅谷巨头激战正酣,马斯克Grok Imagine上线生成10s视频功能。在此背景下,中国AI的Vidu Q3登场,16s音画直出一镜到底,还支持多种功能,位列中国第一、全球第二。
当Sora2遇上国产 Vidu Q2,国产参考生真的更香了!一手亲测
国庆假期Sora 2吸睛,其客串功能将它拉到“AI版抖音”高度。但Vidu去年9月就提出【参考生】视频功能,Vidu Q2已是第5个迭代版本。文章对Vidu Q2参考生视频和Sora 2从一致性、物理规律遵循、运镜等维度进行PK。
苹果应用商店ASO优化:Today、热搜、专题、内购、预定优化介绍(进阶篇五)
ASO进阶篇第五章深入探讨了苹果App Store中Today、热搜、专题、内购和预定等曝光位的优化策略,旨在帮助应用开发者提升App的曝光率和下载量。
合理利用应用商店ASO优化工具,提升APP产品权重和转化率(工具篇)
应用商店优化(ASO)是提升App曝光和下载转化率的关键过程,涉及榜单排名、关键词搜索、转化率及其他展位优化。图标、截图、宣传文本、关键词设置等都是影响用户感知和下载决策的重要因素。