「测试平台」共找到 2961 篇相关文章
开源复现o3图像思考!快手让AI不再被动看图,模型自主生成代码调用工具
Kwai Keye团队提出Thyme新范式,构建技术方案,赋予开源模型“超越图像思考”能力。包括设计训练策略、构建开源配套资源,拓展多模态模型工具使用与决策水平,在基准测试中性能提升显著。
Excel上微软式创新!=COPILOT()函数发布
微软CEO宣布Excel新功能`=COPILOT()`函数,可在单元格直接调用AI。它能进行文本分析、生成内容、整理数据,与计算引擎集成,结果随数据自动更新。现处测试阶段,有调用限制和版本要求。
Google 推出超小杯 AI:Gemma 3 270M!可进手机和浏览器
Google发布Gemma 3家族最小版本Gemma 3 270M,2.7亿参数,能耗低,在同规模模型中表现突出。设计理念是“够用就行”,适合特定任务,已在多平台发布,开源策略效果好。
扣子官宣开源,掀桌大动作背后如何决策?扣子负责人独家披露
7月26日,字节将AI Agent平台「扣子(Coze)」旗下Coze Studio与Coze Loop开源至GitHub,采用Apache 2.0许可证。文章披露开源决策背后故事,探讨开源版目标、定位,以及团队对Agent开发未来的思考。
先别急着给OpenAI加冕!陶哲轩:这种「金牌」,含金量取决于「赛制」
OpenAI 官宣推理模型在 IMO 获金牌水平成绩,此前各模型表现不佳。数学家陶哲轩劝谨慎看待,认为无严格测试条件难比较 AI 与人类。网友看法不一,模型训练方法及 Alexander Wei 受关注。
只因一个“:”,大模型全军覆没
一篇论文发现冒号等符号、“Thought process:”等语句能欺骗LLM,让虚假回答通过。实验表明所有测试模型都会触发假阳性响应。研究人员构建新“评委”模型Master - RM,可让假阳性率接近0%。
比10年专业医生准4倍!微软发布突破性医疗AI系统
微软首席执行官分享新发布的医疗AI系统MAI - DxO,它模型无关,能适配不同语言模型,模拟医生诊断流程。测试显示其准确率远超专业医生,成本大幅下降。此外还发布序贯诊断基准SDBench。
直播预约 | 强化学习训练能否不依赖外部知识优化模型的弱点?
论文提出 SwS 框架,针对强化学习场景,利用模型自我感知弱点驱动自动化问题生成,合成针对性训练数据。还对其进行多项扩展,在多个基准测试集和模型上验证有效,性能提升显著。
斯坦福临床医疗AI横评,DeepSeek把谷歌OpenAI都秒了
斯坦福最新大模型医疗任务评测,构建含35个基准测试的MedHELM综合评估框架。结果显示,DeepSeek R1以66%胜率领先,o3 - mini等模型也各有表现,还分析了成本效益。
登上Science Robotics顶刊!清华团队耗时22年,终于教会机器人踢足球
今年8月,清华赵明国教授团队联合字节跳动Seed等在《Science Robotics》发表论文,提出视觉驱动的反应式足球技能学习框架。该研究历经22年技术接力,成果在真机和赛事中验证,加速进化平台助力研究。