大模型测试」共找到 9649 篇相关文章

产品应用7

突袭Cursor,Windsurf抢发自研模型!性能比肩Claude 3.5、但成本更低,网友好评:响应快、不废话

当地时间5月16日,Windsurf推出首个AI软件工程模型家族SWE - 1。此系列含三款模型,性能比肩Claude 3.5且成本更低。开发者试用评价不错,但也指出存在幻觉问题。Windsurf旨在提升软件开发速度,后续将持续投入。

InfoQ
新闻资讯8

烧2万亿美元却难用?Gary Marcus狂喷AI赛道不靠谱:推理模型只是“模仿秀”,OpenAI一年后倒闭?

知名AI专家Gary Marcus在访谈中称,世界在神经网络投入巨资,但语言模型无法实现AGI目标。他指出其推理模型是“模仿秀”,会出现幻觉,还预测OpenAI或被微软收购。

AI前线
开源动态8

更高智商更快思考!蚂蚁开源最新万亿语言模型,多项复杂推理SOTA

蚂蚁正式发布拥有万亿参数的通用语言模型Ling-1T,超越多个开源和闭源模型,在多项复杂推理基准中取得SOTA表现。它推理和代码能力强,研发采用‘中训练+后训练’,还提出新奖励机制和LPO方法。

量子位
新闻资讯7

Sora 2 惊现 LLM 推理能力,视频生成模型也能搞推理?

Sora 2在科学推理基准测试中获55%成绩,虽不敌GPT - 5,但一个视频生成模型能做推理令人惊讶。Epoch AI实验发现其可能借LLM重写提示词答题,网友也证实背后或有GPT - 4o等处理。此外,Google研究显示视频模型量训练或有推理能力。

AGI Hunt
开源动态8

基于闪电注意力机制,创新高效开源模型

传统Transformer架构处理长文本和复杂推理任务有效率瓶颈,多数领先模型仍依赖传统注意力设计。MiniMax开源基于闪电注意力机制的专家混合模型Minimax,从架构、创新模块、训练框架等多方面优化,表现突出。

AIGC开放社区
算法论文8

九成以上模型止步白银段位,只有3个铂金!通用AI下半场评测标准来了

OpenAI研究员姚顺雨提出AI发展步入新阶段,下半场关键在评估模型真实智能。新加坡国立学等团队提出“通才智能”评测框架,剖析多模态模型短板,推出五级评估体系和测试集,测试结果暴露模型弱点,引发社区积极反响。

机器之心
开源动态8

中科院联合清华等发布视觉语言行动推理模型VLA-R1,让机器人先思考再行动

中科院自动化所、清华和GigaAI联合发布视觉 - 语言 - 行动模型VLA - R1,让机器人先思考再行动。它通过构建数据集教模型思维链,结合监督微调与强化学习提升性能,经多场景测试表现出色。

AIGC开放社区
产品应用8

从网页截图到精准复刻只需30秒:这个新模型刷新了我的认知

智谱AI发布GLM - 4.6V系列模型,是首个支持工具调用的视觉模型。作者对其进行7个场景测试,如识别鸟类、分析赶海地点等,展现出不错性能。该模型速度快、开源,有优势也有小问题,适合开发者和普通用户。

花叔
算法论文8

像开发软件一样造世界,Agent2World来了,把世界模型做成可运行的符号环境

为让模型真正“能行动”,需可执行、可验证的符号世界模型,但现有自动生成路线有困局。研究团队提出 Agent2World,经实验验证有显著效果,能稳定产出高质量符号世界模型,开辟 AI 理解现实环境新可能。

机器之心
算法论文8

快手&中科院 | 提出多模态奖励模型:R1-Reward,比SOTA模型提升5%-15%!

多模态奖励模型对提升多模态语言模型表现至关重要,但现有强化学习算法用于训练存在问题。快手、中科院等团队提出 R1 - Reward,在基准上比 SOTA 提升 5% - 15%,还在快手业务场景成功应用。

AINLPer