「测试全流程」共找到 3890 篇相关文章
Huashu-Excel正式发布!可能、也许、大概是最好用的Excel数据处理和分析skill
花叔开源Huashu - Excel,它能处理Excel或CSV,按八步流程工作,有体检、对账、质控特色。经十份真实数据压测效果好,其设计激发大模型能力、避开缺陷,几乎所有agent都能用。
5w颗星!前Google工程师为Agent打造的设计系统
Anthropic的frontend - design是Claude首个广泛使用设计技能,Impeccable由此起步并扩充功能。它有一次设置流程、23条命令、59条确定性检测规则等,还给出反模式,介绍多种安装方式及使用方法。
让大模型自己写代码、自己进化,GIM和港大这篇ACL主会,把量化因子挖掘重做了一遍
香港大学和GIM提出CogAlpha框架,将Alpha从‘公式’升级为‘代码’,搭建7层21个智能体探索体系,让大模型参与研究流程。在5个数据集上跑赢21个基线方法,还具可解释性。
Anthropic 今天发了一个新产品,可能会让一批做 AI 智能体基础设施的团队失业
Anthropic 发布新产品 Claude Managed Agents,基础设施全包按用量收费。其年经常性收入破 300 亿美元。该产品与 Claude Code 有别,能解决企业痛点,已有不少企业使用,也存在局限性。
Agent当上群主后,群聊变成办事大厅了
文心APP内测“多人、多Agent”群聊功能,像微型“办事处”,能替人办事、支招,效率高。百度文心团队提出Group - MAS攻克技术难关,此功能是全栈技术验证,还将有新玩法。
GPT-5.2已上线24小时:差评如潮!
OpenAI 十周年推出号称强大的 GPT - 5.2,却差评如潮。它在 SimpleBench 测试结果不佳,回答不稳定,编程和艺术创作效果差,情商低、不通人性,审查和安全拒绝机制也饱受诟病。
比Gemini 3记得更多,谷歌新框架将上下文记忆干到了200万!
Google在NeurlPS2025大会推出结合RNN与Transformer的全新架构Titans,能扩展到超200万个token上下文。背后涉及Titans和MIRAS两篇论文,共同推进测试时记忆概念,实验显示新架构性能出色。
多模态大模型理解物理工具吗?PhysToolBench提出了衡量多模态大模型对物理工具理解的基准
香港科技大学等团队提出 PhysToolBench,用于衡量多模态大模型对物理工具的理解。它将理解分为三个等级,测试 32 个模型,揭示了大模型在工具理解上的不足,也为未来发展指明方向。
Qoder + ADB Supabase :5分钟GET超火AI手办生图APP
本文介绍如何用Qoder、阿里云ADB Supabase和通义千问图像编辑模型,快速搭建AI手办生图Flutter移动端应用,无需自建传统后端,涵盖思路、环境准备、各环节配置及流程等内容。
国产GPU芯动科技发布最新芯片,单卡直接堆上了112GB以上的超大显存
9月22日,芯动科技在珠海正式发布“风华3号”全功能GPU,它有诸多亮点,如集成国产RISC - V CPU与兼容CUDA的GPU、原生支持DICOM显示等,还构建了国产GPU完整生态。