基准表发现」共找到 1842 篇相关文章

开源动态8

具身智能大脑+首个SaaS开源框架,智源研究院刷新10项测评基准,加速群体智能新范式

智源研究院推出通用具身大脑RoboBrain 2.0与全球首个具身智能SaaS开源框架RoboOS 2.0并全部开源。前者突破主流AI模型瓶颈,后者实现大脑云端优化与小脑技能免适配注册,降低开发门槛。

量子位
新闻资讯7

Grok 4基准测试被爆极其优异,人类终极考试成绩飙升到45%,碾压o3 和Gemini的20%

API开发者曝光Grok - 4和Grok - 4 Code测试成绩,HLE达35%,推理后飙升到45%,远超o3和Gemini的20%。其他测试也现优异,但成绩引发争议,有人质疑数据污染,也有人支持,目前数据未官方证实。

AGI Hunt
开源动态7

可从复杂文档中提取结构化数据的Python库agentic-doc,支持100+页PDF长文档

LandingAI的Agentic文档提取API可从复杂文档提取结构化数据,Python库agentic-doc封装该API,支持100+页PDF长文档,有自动重试、并行处理等功能,还能可视化调试。

GitHubStore
开源动态8

面向6G环境感知通信!西电开源3Dx3D无线电地图数据集与生成式基准框架

面向6G,西安电子科技大学等团队联合提出高分辨率多模态三维无线电图谱数据集UrbanRadio3D,构建三维无线电图生成框架RadioDiff-3D,弥补了当前主流RM构建方法与数据集的局限。

新智元
新闻资讯7

Qwen 3-235B Aider编程能力击败Claude3.7,成本便宜百倍

Qwen3-235B-A22B在Aider多语言编码基准初步测试中击败Sonnet 3.7 Thinking和OpenAI o1,成本便宜150到600倍。Qwen3-32B准确率超GPT-4.5和GPT-4o ,代码编辑格式正确率达100%。

AI寒武纪
新闻资讯8

津渡生科邓司伟:「AI+生物制造」到底是什么?全链智能已经实现

当前生物制造迈向大规模工业化,AI深度介入。津渡生科邓司伟在大会指出,应构建全链路智能闭环,将AI渗透到发现、验证、生产三阶段,重塑工艺边界,实现专业经验去中心化。

AI科技评论
新闻资讯7

CVPR2025 | 多模态LLM评测Tutorial

多模态大语言模型(MLLMs)研究热门,有效评估成关注焦点。CVPR2025将举办多模态LLM评测Tutorial,梳理评估基准,探讨评估方法,聚焦‘幻觉现象’,团队经验丰富,覆盖多板块内容。

深度学习自然语言处理
新闻资讯8

突发!谷歌 AI 大换血:Hassabis 卸任 CEO、Jeff Dean 离职创业

谷歌 AI 高层大换血,Demis Hassabis 卸任 Google DeepMind 的 CEO 转任主席兼 Alphabet 首席科学家,传奇工程师 Jeff Dean 离职创业,创办 Discovery Loop 做「自动化科学发现」。

AGI Hunt
开源动态7

DeepSeek|从零构建轻量级vLLM:Nano-vLLM,吞吐量逼近原版,代码仅需1200行

开源的vLLM能提升LLM推理速度和资源利用率。近日,DeepSeek AI俞星凯从零构建轻量级Nano - vLLM,代码仅1200行。它有离线推理等功能,基准测试显示吞吐量逼近原版。

AINLPer
开源动态8

图像、视频一模搞定!字节全能原生多模态本地可部署

字节开源原生多模态模型Lance,仅3B激活参数,40G显存就能跑,已登顶huggingface趋势榜。它能进行图像与视频的理解、生成、编辑等操作,在多个基准测试中现优异,多项性能居首。

AIGC开放社区