跑分」共找到 802 篇相关文章

产品应用8

谷歌Gemini 3.1新模型深夜掀桌, 每秒狂飙363 token! 1/4价格暴击Claude

谷歌深夜推出Gemini 3.1 Flash-Lite,输出速度363 token/s,价格仅0.25美元/百万Token,跑分碾压GPT-5 mini和Claude 4.5 Haiku。开发者可通过Google AI Studio体验,企业用户可通过Vertex AI接入。

新智元
新闻资讯8

OpenAI连夜爆出GPT-5.4! 紧急上新GPT-5.3反击谷歌, AI爹味治好了

谷歌DeepMind推出Gemini 3.1 Flash - Lite不到2小时,OpenAI上线GPT - 5.3 Instant,不卷跑分,专治「聊天翻车」,幻觉率降27%,写作能力提升,还剧透GPT - 5.4更快到来。

新智元
产品应用7

Qwen3满血版上线,第一件事就是把搜索按钮干掉了。

Qwen3-max满血版发布,去掉搜索按钮,因模型能力提升无需手动控制。它具备自适应工具调用能力,能自行判断何时使用搜索等工具,思考过程结构化,跑分接近一线模型。

探索AGI
开源动态8

GLM-5真够顶的:超24小时自己代码,700次工具调用、800次切上下文!

GLM - 5正式发布,把开源AI带入长任务时代。它超24小时自己代码,完成GBA模拟器,能力稳定。评测结果佳,在主流测试中编程能力与Claude Opus 4.5对齐,引发网友欢呼。实测还展现多种应用能力。

量子位
算法论文8

ACM MM 2025 Oral | 新加坡国立大学提出FractalForensics,基于形水印的主动深度伪造检测与定位

近些年来,深度伪造主动防御受关注,但现有方法有鲁棒性不稳定等问题。新加坡国立大学等团队提出 FractalForensics 方法,基于形水印实现主动深度伪造检测与定位,实验效果良好。

机器之心
算法论文8

一个md文件收获超400 star,这份综述四大范式全面解析了3D场景生成

南洋理工大学研究者发表《3D Scene Generation: A Survey》综述,系统归纳300+篇论文,将3D场景生成方法四大范式解析,还总结应用,探讨挑战与未来方向,如保真度提升、引入物理约束等。

机器之心
开源动态8

2G 内存 Gemma 3n 完整版!全球首个 10B 内模型杀疯 LMArena:1300 碾压记录

当地时间6月26日,谷歌正式发布Gemma 3n完整版,可在本地硬件运行。它是开源大模型,具多模态能力,最低2GB内存设备就能,E4B模型LMArena测评表现佳,还有MatFormer架构等多项创新。

AI前线
产品应用7

GPT5.5 + Codex 如何一整夜,编程的下一步,不是辅助编程,是可托管执行单元

文章指出GPT - 5.5在Codex里展现出强大自主性,能处理长时程任务。还介绍让其长任务的方法及面临的问题,强调长任务需状态机、证据链等,社区也在构建相关工作流层。

AI进修生
产品应用7

消费级显卡大模型训练门槛再降:Qwen3-1.7B强化学习只需5GB显存

消费级显卡大模型训练门槛再降,Unsloth AI的FP8精度强化学习方案让Qwen3 - 1.7B的GRPO训练只需5GB显存且性能无损。该方案与TorchAO合作,有推理优势,还在内存优化等方面表现出色。

AI工程化
新闻资讯8

100个产品原型同时、新模型Mythos断层领先,连skills效果都好到让团队意外:Anthropic内部到底在发生什么?

Claude Cowork 工程负责人 Felix Rieseberg 在播客中透露,未发布的新模型 Mythos Preview 带来“断层式跃迁”,在安全漏洞检测等方面表现出色。Anthropic 内部可同时上百个产品原型,执行成本降低。还介绍了 Cowork 开发、应用及产品打造经验。

InfoQ