大模型测试」共找到 9649 篇相关文章

算法论文7

ACL2025 | 代码助手火了,但安全吗?所有模型评估结果都很扎心

近期,GitHub Copilot、ChatGPT等AI代码生成工具爆火,效率显著提升,但代码安全性存疑。北团队用CoV-Eval评测20款主流模型,结果不佳,论文还给出优化方向,呼吁代码上线前严格测试

深度学习自然语言处理
算法论文8

从「记忆解题」到「深度推理」:港科推出首个本科数学动态评测基准 UGMathBench

港科团队发表在 ICLR 2025 的研究 UGMathBench,是首个本科数学动态评测体系。它涵盖 16 个学科领域,通过变量扰动创建多版本试题,引入创新指标评估模型推理能力,测试结果揭示了当前模型短板。

AI科技大本营
算法论文8

因果发现模型迎来「理论破局」: DAG-FM 破解异质机制下的因果图识别与涌现难题 | GAIR Paper 116

、清华与稳准智能联合发布因果发现模型DAG - FM,解决了现有模型缺乏理论基础、易产生非法环路和显存爆炸问题。它在理论上证明因果图可识别,架构上避免环路,处理数据能力强,还将推进特定领域预训练。

AI科技评论
开源动态8

谷歌痛失王座?港科贾佳亚团队DreamOmni2开源,超强P图暴击Nano Banana

港科贾佳亚团队开源DreamOmni2,该模型基于FLUX Kontext,能处理多参考图像,在多模态编辑与生成上表现出色,超越谷歌Nano Banana等模型,还构建了新测试集与数据构建范式。

新智元
开源动态8

蚂蚁专用模型超越o3!仅用2K训练样本刷新医疗AI榜单纪录

蚂蚁集团联合团队发布《MedResearcher-R1: Expert-Level Medical Deep Researcher》报告,其医学AI智能体MedResearcher-R1用2100条训练样本在医疗基准测试反超通用模型,靠数据、工具、训练方法三创新实现突破。

量子位
新闻资讯8

全球首个科研LLM竞技场上线!23款顶尖模型火拼:o3夺冠,DeepSeek第四

Ai2耶鲁NYU联合推出科研版「Chatbot Arena」——SciArena,23款顶尖模型比拼科研任务,OpenAI o3夺冠,DeepSeek第四。该平台解决通用基准测试在科研场景‘失效’问题,但其自动评估系统猜科研人偏好远未及格。

新智元
开源动态8

社区供稿 | Hugging Face x 北京中关村学院等机构联合发布生成式基因组模型Carbon:一场关于“生命语言”的范式革命

北京中关村学院等联合发布生成式基因组模型Carbon并开源。Carbon家族有三个版本,旗舰模型Carbon - 3B在多任务匹敌70亿参数的Evo2 - 7B,运行速度快275倍。它在数据、分词、训练上有创新,还实现技术普惠,有多种应用场景。

Hugging Face
算法论文8

MIT新研究:模型加噪声就能替代GRPO/PPO调参

MIT新论文提出,预训练模型周围存在量“专家模型”,只需添加高斯噪声并集成,性能就能比肩甚至超越GRPO/PPO等调参算法。由此启发了RandOpt算法,经测试准确率不错,但也有依赖预训练等缺点。

量子位
新闻资讯7

亚马逊云科技中华区总裁储瑞松:企业实现 Agentic AI 价值的关键在于三技术准备

亚马逊云科技中华区总裁储瑞松在峰会表示,正处 Agentic AI 爆发前夜。其爆发源于模型能力发展、协议出现、推理成本降低等因素。企业实现其价值需做好三技术准备,还推荐了 6 月 27 - 28 日的 AICon 北京站活动。

AI前线
开源动态8

完全透明开源的共情语音模型,三阶段训练,四模块实现端到端对话 | 紫东太初联合长城汽车开源OpenS2S

GPT - 4o、Gemini等顶级语音模型闭源,紫东太初团队联合长城汽车AI Lab开源端到端共情语音语言模型OpenS2S,提供构建共情语音系统新范式,开源所有核心资源,还介绍了技术方案、数据构建及训练流程等。

量子位