「大模型测试」共找到 9855 篇相关文章
学会“吃一堑长一智",性能飙升11%!XSKILL让AI积累经验和技能
XSKILL框架让AI像人一样积累经验和技能,将任务级技能与动作级经验统一到双流设计中,通过视觉接地提取和检索知识,在多个基准测试中显著提升性能,还展现出跨模型迁移性。
英伟达一口气开源多项机器人技术,与迪士尼合作研发物理引擎也开源了
英伟达在机器人学习大会上发布多项开源技术,有Newton物理引擎、Isaac GR00T N1.6基础模型等,还在硬件层面下功夫。顶尖公司、高校已用其技术,全栈式布局或重定义机器人研发规则。
Kimi K2官方技术报告出炉:采用384个专家,训练不靠刷题靠“用自己的话再讲一遍”
Kimi K2官方技术报告公开称霸全球开源模型的秘籍,介绍其训练过程及“秘密配方”,包括MuonClip优化器、大规模Agentic Tool Use数据合成等技术亮点,还提及后阿里通义Qwen3更新击败Kimi K2。
刚刚,OpenAI 发了一份 13 页的「超级智能新政」
OpenAI 发布 13 页政策白皮书《智能时代的产业政策:以人为先》,提出让繁荣惠及所有人、降低风险、普及 AI 三大目标,并给出公共财富基金、效率红利分配、税制改革等具体方案,同时 Sam Altman 表达了对 AI 发展的紧迫感。
评论送书 | Code Agent实战案例——用Pywen Agent、Claude Agent和Codex Agent从零开始构建一款网页游戏
本文展示用三大Code Agent依斯特鲁普效应构建网页游戏,对比其表现,还介绍让AI做测试方案、写文档,体现Code Agent在快速原型开发全生命周期的应用,还推荐相关书籍解答不同人群疑问。
FLUX.2开源了,但是我好像也看到了小公司的无力。
AI绘图曾经的王者FLUX.2部分模型开源,包括dev和即将开源的klein。但与Nano Banana Pro对比,其生图、改图及世界知识表现欠佳。这凸显小厂在大厂资源碾压下的无力,但开源仍有价值。
LoRA中到底有多少参数冗余?新研究:砍掉95%都能保持高性能
这篇创新研究介绍了LoRI技术,证明即使大幅减少LoRA的可训练参数,模型性能依然强劲。研究团队在多个任务上测试了LoRI,发现仅训练LoRA参数的5%,LoRI就能匹配或超越其他方法的性能。
“美国大豆包”Gemini翻身:输出速度碾压同行、智能水平重回第一梯队
过去 Gemini 被吐槽,如今 Google 推出 Gemini 3.8 Flash,六周内第三款 Flash、四个月内第四次更新。新模型成绩佳,输出快,成本低,智能体评测进步大,从经济型选项成生产主力,但实际表现待检验。
Anthropic官宣「封杀」OpenAI!GPT-5发布在即,竟被曝用Claude Code做开发?
本周二,Anthropic切断OpenAI对其大语言模型的Claude API访问权限,指其违约用Claude支援GPT - 5开发及安全测试。此举标志AI巨头围绕数据与接口展开新一轮封锁战,API成战略资源。
Data Agent 落地挑战:忽略技术框架、语义能力和运营体系,投入可能打水漂
Data Agent 落地挑战大,90% 难点源于软件工程,统一语义层建设是关键。企业若忽略场景聚焦、技术框架迭代能力、语义模型和运营体系,投入可能打水漂。掌握相关要素,才能让 AI 代理落地应用,提升企业数据智能化效率。