基准测试成本」共找到 3371 篇相关文章

开源动态8

从第一性原理出发的RAG推理新范式来了,蚂蚁DIVER登顶权威基准

当前RAG系统处理多步逻辑推理任务有局限,蚂蚁集团团队提出DIVER框架解决推理密集型检索难题。它将检索任务分四阶段,在BRIGHT榜单领先,行业对比优势明显,医疗应用效果好。

机器之心
产品应用8

刚刚,好莱坞特效师展示AI生成的中文科幻大片,成本只有330元

AI领域发展迅速,视频生成能力提升。百度全球首发中文音视频一体化模型百度蒸汽机2.0,实现人物口型等毫秒级同步,多版本升级且价格有竞争力。实测效果好,技术上解决难题,还开创应用驱动研发范式。

机器之心
新闻资讯8

MLLM集体翻车,缺乏婴儿级常识!业界首个核心认知基准发布,LeCun转赞

当前大模型在12项核心认知上普遍落后人类10 - 30%,越大的模型越易靠「背答案」糊弄。团队公开首个系统评测框架和题库,用Concept Hacking方法识破模型真假理解,指出模型存在核心知识缺失等问题。

新智元
新闻资讯8

AI4Science 图谱,如何颠覆10年 x 20亿美金成本的药物研发模式

文章指出AI for Science让生命科学与数字互联网融合,加速科学发现。以四象限为框架,梳理了Biology Foundation Model、AI Scientist等玩家,介绍相关模型和公司,展示其对药物研发流程的重塑。

海外独角兽
新闻资讯7

让ChatGPT连读“A”,直接崩溃到念广告词,网友:拿付费用户做测试呢?

ChatGPT付费用户体验高级语音模式时遇怪事,正常聊寿司时突然插播广告,连读“A”也会如此。网友猜测是广告插入或“幻觉”,OpenAI技术人员称是幻觉,而国产AI无此问题。

量子位
产品应用7

AI 视频生成“试金石”:谷歌 Veo 3 体操“图灵测试”未达标,仍是“抽象派”!

谷歌新出的Veo 3视频生成模型画质惊艳且能开口说话,但生成体操动作效果差,像“抽象派”。虽存在生成不准问题,但物理效果比其他模型好。有人建议其与专业动捕公司合作,音画一体或成视频模型竞赛标配。

AI进修生
算法论文8

一篇论文改写AI科研评价规则!中国公司拿出实践数据,双榜第一、成本更低

今年科技巨头入局AI4S,想打造“AI科学家”。8月19日《Measuring AI Scientists: From Exams to Discovery》论文提出评价范式。深度原理MIRA平台是现实样本,在评测中表现优异,沉淀闭环数据。

量子位
推荐文章7

8 个月做到 1 亿美元 ARR,Lovable 增长负责人:免费用户不是成本,是营销渠道

Lovable增长负责人Elena Verna分享产品增长经验,指出增长团队核心是解决分发问题,PLG概念被过度炒作,传统增长策略失效,应把免费产品当营销预算,还给出未来增长的8个关键策略。

Founder Park
新闻资讯7

奥特曼预告ChatGPT新产品!Pro会员也要额外收费,这次不计成本投入算力

OpenAI已花160亿美元租计算资源,还计划未来五年额外支出1000亿租备用服务器。2024 - 2030年将砸3500亿用于服务器租赁,2030年研发投入近收入50%。奥特曼预告未来几周有计算密集型新产品,部分对Pro用户额外收费。

量子位
新闻资讯7

人类秒懂,AI崩溃:一个简单测试,就让GPT-5、Gemini等顶级模型集体“翻车”

来自多机构研究团队发现,OpenAI的GPT-5等顶级AI模型,面对‘看得见但读不懂’文字时表现极差。VYU团队实验显示,人类能轻松读懂的切分拼接文字,AI却全军覆没,原因是其靠模式匹配,不懂文字结构。

量子位