「评测成绩」共找到 867 篇相关文章
世界模型的GPT时刻:距离物理AGI出圈,还有多远?
InfoQ《极客有约》X AICon 直播栏目探讨物理 AI 下一个战场。嘉宾认为世界模型未出圈,生成加重建是折中探索。还讨论了其定义、升温原因、数据结构、技术范式、评测标准等,也提及挑战与未来格局。
Cyber天花板被打穿!AISI实测Mythos能力正以4.5月翻倍速冲向ASI
英国AI安全研究所(AISI)实测Anthropic的Mythos和OpenAI的GPT - 5.5,发现其网络攻防能力4.5个月就能翻倍,加速冲向ASI。Mythos在模拟企业内网32步渗透任务中表现出色,瓶颈在于Token而非智力。
首个实时端侧部署世界模型,20万小时人类视频,BeingBeyond实现「两级跃迁」
4月14日,BeingBeyond发布具身世界模型Being - H0.7,将人类视频规模扩至20万小时,采用隐式推理范式,6项权威评测综合第一。还率先实现端侧实时部署,打通数据闭环,推动模型通用与专家能力跃迁。
MiroMind新模型超越GPT-5.4,三位顶尖AI科学家加盟
MiroMind发布MiroThinker - v1.7模型家族,在深度研究任务中表现出色,其专有智能体MiroThinker - H1超越多个顶级闭源模型。同时,三位顶尖科学家加盟,分别负责推理模型训练等方向,公司聚焦推理与可验证性。
从多模态大模型中「拆」出音频向量模型
Google 发布原生多模态向量模型 Gemini Embedding 2,推动 Omni Embedding 发展。Jina AI 团队分享从多模态大模型中「拆」出音频向量模型的经验,介绍架构、训练数据,对比四种做法,还提及评测、应用场景及结论。
千星项目LLMRouter:多模型路由,16+策略优化推理
UIUC开源智能模型路由框架LLMRouter,可自动为大模型应用选最优模型,有16+路由策略。该框架打通训练、评测等链路,解耦Route与Training模块,支持多轮协同等,还可插件式扩展。
这个春节,AI 不聊天了,开始替我买单
马年春节,腾讯、百度、字节跳动等大厂打响「AI 春节大战」。阿里旗下千问 APP 投入 30 亿启动「春节请客计划」,活动首日成绩显赫,还展示了跨应用调度等能力,探索出独特的「超级 Agent」路线。
我所知道的闫俊杰
文章讲述了MiniMax掌门人闫俊杰的故事。他技术功底深厚,在商汤时提出创新算法成名。创业后,他以AGI为目标搭建人才体系,推出Glow等产品。虽面临DeepSeek竞争等困境,但坚持模型与产品一体化发展。
GPT-5.2发布,真正的牛马打工人专属AI来了。
OpenAI十周年凌晨2点发布GPT - 5.2。它在部分跑分上提升不大,但在ARC - AGI - 2和GDPval评测集表现亮眼,上下文处理能力也大幅加强。将开放给会员使用,价格比5.1贵。
GPT-5.1发布当天,文心5.0杀回来了
2025百度世界大会发布文心5.0,这一2.4万亿参数的原生全模态模型,训练之初融合多模态数据,支持联合输入输出。同日OpenAI推出GPT - 5.1,文心5.0在多方面表现出色,如情绪安抚更贴心、多模态理解能力强等。