「测试工具」共找到 3407 篇相关文章
谷歌深夜放出 IMO 金牌模型,多项测试力压 Grok 4、OpenAI o3!网友评论两极分化
8月1日晚谷歌向Ultra订阅用户推Deep Think功能,Gemini 2.5 Deep Think模型在IMO夺冠。它是多智能体模型,能并行处理问题。多项测试中表现优于Grok 4、o3,不过网友评价不一。
谷歌深夜放出 IMO 金牌模型,多项测试力压 Grok 4、OpenAI o3!网友评论两极分化
昨夜谷歌向 Google AI Ultra 订阅用户推 Deep Think 功能,Gemini 2.5 Deep Think 模型获 IMO 金牌。它是多智能体模型,通过并行思维输出答案,在多领域及测试中表现佳,但网友评价不一。
Google 推出了免费 Vibe Coding 工具,一键集成聊天、视频、图像AI,真的很氛围。
谷歌推出免费 Vibe Coding 工具,集成多种 AI 功能。谷歌 AI Studio 的 Built 模式更新,能混合匹配 AI 功能,自动连接模型和 API。用户无需了解 API 文档,可快速做出 MVP,谷歌 AI API 免费(限速)。
比NotebookLM更实用,基于LLM的AI PPT开源工具,连配套演讲稿都给写好了。
现在很多人用Nano Banana、NotebookLM做PPT,但存在字体、内容契合度等问题。本文推荐基于LLM的开源AI PPT工具LandPPT,它支持多格式文档生成、有深度研究等功能,协议宽松可商用。
马斯克发布 Grok 4 模型:推理能力较前代提升 10 倍,各学科测试接近满分
xAI 发布 Grok 4 及 Grok 4 Heavy 模型,推理能力较前代提升 10 倍,多测试接近满分。马斯克称其为世界最好 AI。它在多方面表现出色,如长任务能力强、推理效率佳等,但代码能力欠佳,且付费昂贵。后续还将推多款模型。
ICLR 2026 | 7B小模型干翻GPT-5?AdaResoner实现Agentic Vision的主动「视觉工具思考」
文章介绍了AdaResoner模型,它学会‘何时用工具’,在拼图推理上击败GPT - 5。Google为Gemini 3 Flash引入‘Agentic Vision’,与AdaResoner殊途同归。AdaResoner有独特训练方法,提升小模型性能。
GPT-5编程成绩有猫腻!自删23道测试题,关键基准还是自己提的
有人发现OpenAI测试GPT-5编程能力时,用的SWE-bench Verified子集仅477题,自行省略23题。若这些题默认零分,其得分比Claude Opus 4.1低。且该基准还是OpenAI自己提出的。
GLM-5.2真正的跨越:CritPt密闭物理数据集测试得分20.9%,打平Opus-4.8
GLM - 5.2在CritPt密闭物理数据集测试中表现亮眼,与Claude Opus 4.8得分并列,远超其他开源模型,还击败多款闭源模型,实现4.5倍代际飞跃,标志开源模型科学推理能力进步。
打穿 AI 智商测试!GPT-6 Astra 的符号世界模型,是突破还是钞能力刷分?
OpenAI的GPT-6 Astra亮相,在ARC - AGI - 3测试成绩逼近100%,远超GPT - 5.6 Sol。它生成的符号世界模型被认为是AI迈向高级推理必经之路。不过出题人指出其靠Harness加持,离AGI还远。
超越Claude 3.5和o1!8B模型靠「分层投票+测试时训练」逆袭
近日MIT研究者发现测试时训练在大模型应对复杂推理问题时,能分解任务提升回答准确率。8B的lemma3模型经此方法,在ARC和BBH数据集上性能显著提升,超Claude 3.5等。但该策略部署效率低。