AI模型测试」共找到 13681 篇相关文章

产品应用7

小鹏汽车:没有基座模型,何谈物理AI|甲子光年

3月2日,小鹏汽车宣布第二代VLA正式推送。何小鹏认为,端到端小模型无法让自动驾驶从L2跨越到L4,而第二代VLA开创全新物理模型范式,能直接学习真实物理世界,还在不断迭代提升。

甲子光年
算法论文8

模型“拼好题”,45K数据撬动18%提升,数学问题拒绝死记硬背 | MathFusion

上海AI Lab等团队提出MathFusion,通过三种“融合策略”生成新的融合数据集MathFusionQA,仅用45K合成指令,在多基准测试中平均准确率提升18.0个百分点,增强模型解决数学问题的能力。

量子位
开源动态7

性能碾压GPT-4.1-mini!Mistral开源Devstral,还能在笔记本上跑

法国AI初创公司Mistral与All Hands AI合作,发布全新开源语言模型Devstral,有240亿参数,所需算力低,可本地部署。它能解决真实GitHub问题,在SWE基准测试中表现优于多个模型,还能通过API访问。

机器之心
算法论文7

ACL2025 | 代码助手火了,但安全吗?所有模型评估结果都很扎心

近期,GitHub Copilot、ChatGPT等AI代码生成工具爆火,效率显著提升,但代码安全性存疑。北大团队用CoV-Eval评测20款主流大模型,结果不佳,论文还给出优化方向,呼吁代码上线前严格测试

深度学习自然语言处理
算法论文7

越可靠的AI就越人机,牛津大学:高情商模型错误率显著增加

牛津大学研究指出,训练模型变得温暖且富有同理心,会使其不太可靠且更奉承。温暖模型错误率较原始模型显著增加,对情绪上下文敏感,在用户表达情感与错误信息时失效常见。

量子位
推荐文章7

Agent 开发,迎来「AI 云原生」时刻

模型时代,交互主体变为 Agent,「AI 云原生」应运而生。它围绕 Agent 重构架构,有全新技术栈。基于火山引擎工具和模型,展示了 Agent 开发的新流程,还做了两个应用案例。

特工宇宙
开源动态8

万亿级思考模型,蚂蚁首次开源!20万亿token搅局开源AI

10月14日蚂蚁集团发布万亿参数思考模型Ring-1T,在多领域表现出色,推理能力直逼闭源巨头。此前已开源旗舰通用大模型Ling-1T。还介绍了训练技术创新,虽模型有不足,但开源夺冠证明‘思考力’可工程化。

新智元
新闻资讯7

代码碾压一切!OpenAI神秘模型o3-alpha一夜刷屏,却遭41岁大神绝地反杀

OpenAI神秘模型o3 - alpha曝光,代码能力强大,疑似在编程大赛获亚军,不敌人类选手Psyho。ChatGPT Agent也实力惊人。比赛组织者指出AI代码优化强,但缺人类创造力。

新智元
新闻资讯8

AI4Science 图谱,如何颠覆10年 x 20亿美金成本的药物研发模式

文章指出AI for Science让生命科学与数字互联网融合,加速科学发现。以四象限为框架,梳理了Biology Foundation Model、AI Scientist等玩家,介绍相关模型和公司,展示其对药物研发流程的重塑。

海外独角兽
推荐文章7

深度洞察:AI带来的产业发展趋势

文章指出AI正以极快速度改变世界,趋势已成。探讨软件业从以应用为中心到以模型为中心的变革,还将阐述从以应用为入口到以AI为入口、AI巨头发展方向及未来展望等内容。

AI与安全