数学基准测试」共找到 2303 篇相关文章

推荐文章8

最权威的Skills编写指南来了!33页,Anthropic亲自发布

Anthropic发布33页《Skills编写完整指南》。Skills能为智能体注入行业经验与工作流,实现复杂任务自动化。指南梳理了编写逻辑,涵盖定制、构思、测试、发布等全生命周期内容。

AIGC开放社区
算法论文8

从视觉出发统一多模态!颜水成团队最新研究:不再把图像编解码器塞进LLM|ICLR'2026

NVIDIA研究员Jim Fan称AI正经历第二次预训练范式转移。颜水成团队Muddit模型从视觉先验出发,用离散扩散框架统一文生图、图生文和VQA,挑战多模态“语言中心论”,在多任务表现出色。

量子位
新闻资讯8

GPT-5.2 上线!全面超越 Claude Opus4.5 及 Gemimi 3.0 Pro

OpenAI 正式宣布 GPT-5.2 全面上线,一口气推出三个版本。GPT-5.2 Thinking 在推理能力上拉开代差,是 OpenAI 首个达人类专家水平的模型。各版本定位清晰,不同用户使用时间有别。

AGI Hunt
开源动态8

面壁小钢炮 VoxCPM-TTS:开源端到端 TTS,轻量高效低延迟

面壁提出基于扩散自回归建模的端到端语音生成模型 VoxCPM,构建于 MiniCPM - 4 之上。它克服传统离散 token 方法缺陷,实现语义与声学特征解耦,有上下文感知语音生成和零样本语音克隆能力,低延迟。

带你学AI
开源动态7

开源要变天了,刚刚,OpenAI开源gpt-oss-20/120b,o4-mini水平,主打Agentic

OpenAI正式开源gpt-oss模型,Anthropic推出Claude Opus 4.1,Google DeepMind发布Genie 3。gpt-oss有20B和120B两个版本,前者可在边缘设备运行,后者综合能力强,在多方面表现出色。

PaperAgent
开源动态8

文心大模型 4.5 系列正式开源,涵盖 10 余款模型

6月30日,百度正式开源文心大模型4.5系列,含10款模型,实现预训练权重和推理代码全开源。可在飞桨星河社区等平台下载,百度实现框架与模型“双层开源”,技术创新多,性能表现优。

AI前线
算法论文7

DeepMind 提出 CaMeL,抵御 LLM 提示词注入

谷歌DeepMind研究人员提出CaMeL,作为围绕LLM的防御层,通过提取查询中的控制流和数据流阻止恶意输入,能在AgentDojo基准测试中抵御67%攻击,采用传统软件安全原则。

InfoQ
新闻资讯7

DeepSeek深夜更新后自曝:我是V4(?!)

DeepSeek网页端深夜大更新,推出「快速模式」和「专家模式」,还有「视觉模型」开启灰度测试。虽官方未说明,但网友推测专家模式可能是V4或V4 Lite,完整版V4或许不远。

量子位
算法论文8

CVPR 2025 | 解决XR算力瓶颈,FovealSeg框架实现毫秒级IOI分割

来自纽约大学和Meta Reality Labs的联合研究提出Foveated Instance Segmentation新方法。FovealSeg框架结合眼动追踪,能解决XR算力瓶颈,实现毫秒级IOI分割,在多数据集测试中速度与精度双赢。

机器之心
7

全网玩疯的SBTI,挤爆了服务器!网友用Claude手搓复刻版

全网被新型SBTI人格测试刷屏,服务器被挤崩。它解构MBTI框架,精准捕捉年轻人情绪。开发者用Claude Code完成逆向复刻,还做了改进。如今做产品门槛降低,未来SBTI或由AI打造。

新智元