智能测试平台」共找到 5762 篇相关文章

新闻资讯7

Anthropic最新战报:年化收入突破300亿美元,反超OpenAI,千家企业客户单笔年消费超百万

Anthropic宣布与谷歌和博通扩大合作采购算力,首席财务官称是为跟上增长步伐。其年化营收破300亿美元超OpenAI,超千家企业客户单笔年消费超百万,Claude在多平台上线,二级市场已重新定价。

AI寒武纪
新闻资讯7

OpenAI新模型Day0就被嫌弃!排名拉垮,不如一月底发布的国产模型

OpenAI推出GPT - 5.4 mini和nano模型,主打快速经济,针对编程等优化。但评测中GPT - 5.4 mini排名不佳,不如国产Kimi 2.5,且价格对比有争议。不过与自家旧版比有提升,网友测试有亮点。

量子位
新闻资讯7

起底Sharpa:一家还没赚钱的公司为何估值快赶上禾赛?

神秘具身智能公司Sharpa亮相引发关注。它以灵巧手技术获认可,后转型整机公司发布机器人North。其团队有禾赛背景,自带硬科技基因,受资本青睐,反映供应链切入下游和整机的产业趋势。

AI科技评论
开源动态8

AI编程节省95% token,工具调用上限狂飙20倍,开源记忆系统登顶GitHub热榜

Claude - Mem是一款登顶GitHub热榜的持久化记忆系统,直击AI编程助手跨会话失忆痛点。它免费且省token,通过‘三层渐进式披露’架构,常规省90%,测试阶段省95%,工具调用上限提20倍。

量子位
新闻资讯8

Clawdbot开发者:未来一大批应用都会消失,提示词就是新的interface

Clawdbot开发者Peter Steinberger在采访中分享诸多观点,认为今年是「个人助理」之年,每个人应构建智能体探索记忆机制;指出GUI糟糕,多数MCP应做成CLI;还称未来大批应用会消失,提示词是新界面。

Founder Park
新闻资讯8

百川开源医疗大模型 M3,王小川:今年会发布两款 ToC 产品,正在做硬件

1月初OpenAI、Anthropic推出医疗产品,百川智能也开源医疗大模型Baichuan - M3,评测成绩突出。王小川表示今年会发布两款ToC产品,还在做硬件,阐述了百川在医疗领域的目标与策略。

Founder Park
新闻资讯8

倒反天罡!Gemini Flash表现超越Pro,“帕累托前沿已经反转了”

Gemini 3 Flash在SWE - Bench Verified测试中分数超Pro,速度和性价比也更优。谷歌解释是因Flash有未用于Pro的优化技术。开发者认为应停止‘旗舰版迷信’,强化学习让小模型也能实现‘降维打击’。

量子位
新闻资讯7

GPT-5准确率不足40%!北大发布多模态、高难度化学基准SUPERChem

北大团队发布多模态、高难度化学基准SUPERChem,构建评估大语言模型化学推理能力新体系。测试显示,GPT - 5准确率仅38.5%,与低年级本科生相当,且模型在高阶推理有短板,该基准为模型优化指明方向。

新智元
新闻资讯8

Runway Gen-4.5刷屏发布,把重量、尘土和光影都做对了,网友:颠覆

Runway Gen-4.5突袭发布,获“视频生成AGI时刻”评价,在Artificial Analysis测试中拿下SOTA。它能精准执行复杂指令,物理还原与视觉精准度强,官方将逐步开放使用权限,还直言其存在因果推理等局限。

量子位
新闻资讯7

4倍速吊打Cursor新模型!英伟达数千GB200堆出的SWE-1.5,圆了Devin的梦!实测被曝性能“滑铁卢”?

Cognition推出全新AI编码模型SWE-1.5,专为软件工程任务设计,运行速度快,在基准测试中成绩良好。它基于GB200芯片训练,有定制编码环境,开发有新战略,还与Cursor新模型Composer对比引发关注。

InfoQ