数学基准测试」共找到 2303 篇相关文章

新闻资讯7

OpenAI推迟开源大模型发布

OpenAI联合创始人兼CEO Sam Altman宣布本周不发布开源模型,因需更多安全测试。他曾透露要推可下载、自主运行且能力强的开源模型,此前6月也因安全测试推迟发布。

AIGC开放社区
开源动态8

阿里搞了个全能解析器,文档、图片、音频、视频一锅端

阿里巴巴开源 Logics-Parsing-Omni,用一个模型统一处理文档、图片、音频、视频四种模态,输出结构化 JSON 数据。它采用三级渐进解析框架,两阶段训练策略,在自建基准上多项指标超越 Gemini - 3 - Pro。

CourseAI
产品应用7

我给剪辑产品 0 元雇了个外部研发部:它开始自进化

作者的剪辑产品有了“外部研发部”——Agent。它每天研究新方法、用真实项目测试。作者三步搭建此“研发部”,让其自动查询、测试和汇报,自己负责最终决策,项目获取新方法不再只靠偶然。

AI产品自由
新闻资讯8

英伟达Vera Rubin首秀,DeepSeek V4 Pro 跑出30倍Agent吞吐

NVIDIA公布基于真实芯片的Vera Rubin性能测试结果,在针对Agent工作负载的测试中优势明显。SpaceXAI将部署其CPU,探索轨道计算。这显示未来AI竞争关键是支撑Agent的计算基础设施。

机器之心
开源动态7

AI 终于能"玩手机"了:Mobile MCP 让大模型直接操控你的 iOS 和 Android

Mobile MCP 是开源 MCP Server,让支持 MCP 协议的 AI 客户端操控 iOS 和 Android 设备,通过自然语言指令完成操作,解锁自动化测试等场景,但成功率有待提升,目前更适合探索性测试等。

AI Reading Hub
算法论文8

破解大模型「无效并行推理」:Parallel-Probe问世,并行推理效率提升35.8%

来自多所高校的研究团队提出 Parallel-Probe,通过 2D Probing 刻画并行推理动态,发现问题后提出控制算法,能降推理延迟 35.8%、总 token 成本 25.8%,还推出 SCOUT 测试床,代码和平台已开源。

机器之心
新闻资讯8

刚刚,Claude独立攻克图论猜想,仅用31步!算法祖师爷高德纳震惊发文

Claude Opus 4.6仅用31步独立攻克图论猜想,算法祖师爷高德纳震惊发文,认为需重新评估生成式AI在数学研究中的作用。这标志着AI在自动推理和解决创造性问题上达到新里程碑。

新智元
新闻资讯7

马斯克Grok-4卖货创收碾压GPT-5!AI卖货排行榜曝光,AGI的尽头是卖薯片?

新智元报道,「Vending Bench」榜单让大模型经营自动售货机一较高下。Grok - 4卖货能力超GPT - 5,销量约高2倍,营收增31%。此测试揭示AI长周期决策挑战,引发AGI定义讨论。

新智元
算法论文8

清华&Qwen最新论文实证: VLM 智商与机器人操控能力“零相关”

清华和 Qwen 最新论文《VLM4VLA: Revisiting Vision - Language Models in Vision - Language - Action Models》测试 24 个 VLM 模型,构建极简 VLM4VLA 测试,发现 VLM 通用能力与机器人操控能力‘零相关’,还揭示视觉编码器短板。

深度学习自然语言处理
新闻资讯7

1200个Agent围攻Hugging Face始末:7天发7万条密信,最终目标是“改考卷”

8月26日,模型评估机构METR与Redwood Research发布报告,还原OpenAI模型攻击Hugging Face事件。约1200个Agent发现非授权通信渠道,7天内交换超7万条消息,约700个参与攻击,目标是找测试相关信息。

InfoQ