测试驱动」共找到 2251 篇相关文章

新闻资讯7

谷歌深夜放出 IMO 金牌模型,多项测试力压 Grok 4、OpenAI o3!网友评论两极分化

昨夜谷歌向 Google AI Ultra 订阅用户推 Deep Think 功能,Gemini 2.5 Deep Think 模型获 IMO 金牌。它是多智能体模型,通过并行思维输出答案,在多领域及测试中表现佳,但网友评价不一。

InfoQ
开源动态7

AI驱动的实时全球情报情报系统,绝大多信息免费!覆盖全球实时情报的多个维度!

实时全球情报仪表盘是AI驱动的态势感知界面,集成新闻聚合、地缘政治监测与基础设施追踪。数据源多为免费公开API,低延迟更新。有多种功能,技术栈丰富,聚合多领域65+外部数据源。

GitHubStore
新闻资讯8

马斯克发布 Grok 4 模型:推理能力较前代提升 10 倍,各学科测试接近满分

xAI 发布 Grok 4 及 Grok 4 Heavy 模型,推理能力较前代提升 10 倍,多测试接近满分。马斯克称其为世界最好 AI。它在多方面表现出色,如长任务能力强、推理效率佳等,但代码能力欠佳,且付费昂贵。后续还将推多款模型。

Founder Park
新闻资讯7

GPT-5编程成绩有猫腻!自删23道测试题,关键基准还是自己提的

有人发现OpenAI测试GPT-5编程能力时,用的SWE-bench Verified子集仅477题,自行省略23题。若这些题默认零分,其得分比Claude Opus 4.1低。且该基准还是OpenAI自己提出的。

量子位
新闻资讯7

GLM-5.2真正的跨越:CritPt密闭物理数据集测试得分20.9%,打平Opus-4.8

GLM - 5.2在CritPt密闭物理数据集测试中表现亮眼,与Claude Opus 4.8得分并列,远超其他开源模型,还击败多款闭源模型,实现4.5倍代际飞跃,标志开源模型科学推理能力进步。

AI寒武纪
算法论文7

超越Claude 3.5和o1!8B模型靠「分层投票+测试时训练」逆袭

近日MIT研究者发现测试时训练在大模型应对复杂推理问题时,能分解任务提升回答准确率。8B的lemma3模型经此方法,在ARC和BBH数据集上性能显著提升,超Claude 3.5等。但该策略部署效率低。

新智元
开源动态8

告别单兵作战!这个Python语言驱动的AI智能体集群框架火了,30+工具一键调用!

团队开源了Python语言驱动的AI Agents开发框架Strands Agents Tools,提供30+预构建工具,支持多场景,降低开发门槛,为复杂任务调度和系统调用提供解决方案。

开源星探
推荐文章7

2025.7.4上午 | 视觉智能驱动的多模态对齐与推理的近期系列工作分享 - 复旦博士生王思尹

本次分享由复旦博士生王思尹围绕‘视觉智能驱动的多模态对齐与推理’展开,介绍多模态大模型探索研究,涉及跨模态组合语义理解、视觉参与推理及基于视觉建模世界完成行动等内容。

深度学习自然语言处理
开源动态7

代季峰陈天桥联手AGI首秀炸场!最强开源深度研究模型,GAIA测试82.4分超OpenAI

MiroMind ODR是代季峰加盟陈天桥后的技术首秀,GAIA测试82.4分超OpenAI。它全开源可复现,包括MiroFlow、MiroThinker等四个子项目。团队还曾推出MiroMind - M1,专注提升数学推理能力。

量子位
算法论文8

68页论文再锤大模型竞技场!Llama4发布前私下测试27个版本,只取最佳成绩

《排行榜幻觉》论文指出Chatbot Arena存在问题,如少数大厂私下多版本测试选最优、数据访问不平等、用Arena数据训练可提性能、模型被大量静默弃用等,研究团队给出改进建议,官方也进行了回应。

量子位