数学推理测试」共找到 3543 篇相关文章

开源动态7

字节开源了一个了不得的模型!

字节跳动开源统一多模态基础模型BAGEL,一个模型能同时理解和生成文本、图像、视频。部署测试有亮点但效果不稳定,还分享该模型体验Demo、地址及安装使用教程。

探索AGI
开源动态8

Linear-MoE:线性注意力遇上混合专家的开源实践

近年来,线性序列建模和混合专家(MoE)研究进步大,但两者结合研究少,相关开源实现缺失。上海人工智能实验室团队的 Linear - MoE 首次实现两者高效结合并开源技术框架,实验验证其有诸多优势。

机器之心
新闻资讯7

最新!OpenAI:GPT-5将实现大统一,Codex最佳实践是这样的

OpenAI Codex在Reddit AMA活动中,核心负责人围绕先推云端代理、GPT - 5与Operator整合等问题给出路线图。如Codex - 1预览情况、CLI设计、使用场景、安全模型、接入计费及API生态等方面都有说明。

AI寒武纪
算法论文7

DeepMind 提出 CaMeL,抵御 LLM 提示词注入

谷歌DeepMind研究人员提出CaMeL,作为围绕LLM的防御层,通过提取查询中的控制流和数据流阻止恶意输入,能在AgentDojo基准测试中抵御67%攻击,采用传统软件安全原则。

InfoQ
开源动态8

一个LoRA实现GPT-4o级图像编辑!浙大哈佛新模型冲上Hugging Face榜二

随着Gemini、GPT - 4o等把基于文本的图像编辑推向高峰,提高性能常需大量数据和大参数量模型。而浙大哈佛团队提出ICEdit,用少量数据和参数实现高质量图像编辑,媲美甚至超越商业大模型。

新智元
新闻资讯7

英伟达CEO黄仁勋:错失中国AI市场,是美国巨大损失

在“Knowledge 2025”大会上,英伟达CEO黄仁勋接受CNBC专访,称中国AI市场未来2 - 3年达500亿美元,错过是美国巨大损失。还提到AI影响、与ServiceNow合作成果等,英伟达股价有波动,财报受关注。

AIGC开放社区
新闻资讯8

前沿模型被曝年度重大漏洞:加密思维链可被轻松提取,GPT,Claude,Gemini 无一幸免

一篇 116 页论文揭示前沿模型思维链重大安全漏洞,Anthropic、OpenAI、Google 的 API 因架构问题,模型隐藏推理过程可通过两次 API 调用被大规模提取,还会带来多种安全威胁。

AGI Hunt
算法论文8

微小目标漏检只是因为小?从数据到代码:一文读懂 AI-TOD-R 与 DCFL 如何解决旋转微小目标检测

此文指出旋转微小目标检测存在数据空白、学习偏差、特征易丢失等难题,提出AI-TOD-R数据集、全检测范式基准和DCFL框架。DCFL可缓解偏差,在8个数据集达SOTA,还给出实战代码案例。

机器学习AI算法工程
推荐文章7

“如果你不能用300行代码写个Cursor,这行你就别待了!”Ralph Loop创造者、Claude Code核心技术设计者的暴论

Ralph Loop 创造者 Geoffrey Huntley 在播客称软件开发已死,任何人用 Cursor 就能生成代码。他还谈到 K 型分化下职业生存法则、Ralph Loop 设计哲学、代码审查问题,并给出学习和职业发展建议。

InfoQ
算法论文8

谁说3DGS必须靠LiDAR?如视Argus入选ECCV,让图像也能提供LiDAR级位姿约束

消费级3DGS应用走向普通用户,但需精确位姿约束,过去靠LiDAR,成本高。如视Argus入选ECCV 2026,能从图像预测位姿等,为3DGS提供精准约束,推动其走向低成本采集时代。

机器之心