「跨平台评测」共找到 2120 篇相关文章
Deepseek V4 Pro发布,除了多模态,满足我对模型的所有想象
DeepSeek官方文档更新模型日期,意味着DeepSeek V4 Pro正式版来临,已在官方API提供。它采用MoE设计,接口能力强,Agent能力得到大幅强化,评测成绩亮眼,价格实惠且有API兼容性,不过有并发限制,近期还将上调价格。
Fable5仅做对3.5%!大模型会看图,但还没有主动视觉
本文介绍了专门测量「主动观察」能力的视觉推理基准 ActiveVision,评测显示无外部工具时,大模型与人类准确率有近 9 倍差距,用工具后虽提升但仍远不如人类,还说明了其出题与避免取巧的方式。
谷歌风雨飘摇,市值蒸发数千亿美元!Gemini Spark能救场吗?
近期谷歌接连流失核心人才,资本市场反应强烈,市值蒸发数千亿美元。同时产品节奏不佳,Gemini 3.5 Pro疑跳票。在此背景下,谷歌推出Gemini Spark,它能跨应用完成任务,但定价遭质疑,谷歌能否靠它破局存疑。
BeyondSWE:AI编程80分是真的强,还是考卷太简单?
前沿模型在SWE - bench Verified测试中得分超80%,但该测试像开卷填空。中国人民大学提出BeyondSWE重新设计评测,规模是前者18倍,模型得分全跌破45%。还提出SearchSWE框架,结果显示搜索与编码能力融合待提升。
GPT-5.2破解数论猜想获陶哲轩认证!OpenAI副总裁曝大动作:正改模型核心设计,吊打90%研究生但难出颠覆性发现
OpenAI 发布由 GPT - 5.2 加持的科研平台 Prism 并免费开放。副总裁 Kevin Weil 称目前模型难有颠覆性发现,但能加速科研。GPT - 5 能力超 90% 研究生,OpenAI 将优化其设计,让它更谦逊并自我核查。
Ilya重新定义AGI: 为什么ChatGPT离真正的AGI还很远
OpenAI前首席科学家Ilya在访谈中提出对AGI的新定义,还指出AI规模时代结束,未来拼想法和研究深度。他分析模型评测强但经济影响弱的原因,阐述人类价值函数作用,且SSI战略或调整。
谷歌新版Gemini马甲被扒! LMArena实测:唯一能看懂表的AI, GPT-5乱答
谷歌Gemini 3.0疑似上线LMArena,其Pro和Flash马甲被扒。实测中,Gemini 3 Pro能精确看表,GPT - 5等表现不佳;SVG测试有提升但也有不足;还能作曲。不过评测方式老套,希望有新花样。
最懂英伟达的CoreWeave,为啥突然花钱买了个强化学习作坊?
算力巨头CoreWeave市值达483.9亿美元,收购专攻强化学习训练AI智能体的OpenPipe。CoreWeave想打造全能平台,此前已收购W&B,此次收购标志其涉足智能体核心训练环节。OpenPipe的ART框架有独特优势。
老黄太难了!英伟达Q2营收467亿美元创纪录,股价盘后还跌了5%
英伟达Q2财报营收和每股收益超预期,达467亿美元,数据中心业务贡献大,Blackwell平台表现亮眼。尽管给出高营收指引并扩大回购授权,股价盘后仍下跌。各业务均有进展,正重新定义计算产业规则。
首届国产机器人足球赛,最忙的是担架
国内首个机器人主体足球赛在北京举行,四支高校战队用加速进化T1平台参赛,全程机器人自主行动。清华火神队夺冠,不过比赛中机器人失误多。主办方预计5年提升其水平,赛事目标是2050年机器人队夺世界杯。