「AI模型测试」共找到 13965 篇相关文章
四大顶尖模型对决!6000 字测评带你看Deepseek R1有多强
昨天 Deepseek-R1 0528 正式开源,作者让它与 Claude Opus 4、Sonnet 4、Gemini 2.5 Pro 在六个前端开发任务中对决。结果显示,Deepseek-R1 在多数测试表现出色,且价格优势明显。
苦研10年无果,千万经费打水漂!AI黑箱依然无解,谷歌撕破脸
ChatGPT「舔狗化」暴露AI缺乏可解释性,谷歌和Anthropic就「机制可解释性」产生争论。谷歌DeepMind不再将其作研究重点,Anthropic则主张重视。十多年研究成果有限,或应采取「自上而下」研究方式。
谷歌Nano Banana Pro炸了!硅谷AI半壁江山同框,网友:PS已死
谷歌推出基于Gemini 3 Pro的图像生成模型Nano Banana Pro,在图像编辑和生成上实现史诗级进化,有更广知识储备、超强文字渲染和精准细节把控。它支持4K原生,知识推理强还能直连搜索,玩法多样但也有改进空间。
只用国产GPU训练的大模型性能飙升100%!国内唯一,更懂你
科大讯飞发布全国产算力训练的讯飞星火X1.5,推理效率暴涨100%,综合性能跻身全球顶级。还首发非自回归语音大模型架构,效果提升、成本降低。此外,展示多领域应用成果,发布相关产品,开源智能体平台。
o系列模型开创者,OpenAI研究副总裁官宣离职,还是codex,GPT-5,GPT-4核心
OpenAI研究负责人Jerry Tworek工作近七年后宣布离职,他是“波兰帮”成员、研究副总,贡献包括o1和o3模型、Codex等,离开是为探索在OpenAI难进行的研究。
扩散模型自引导新范式:直接交换token就能变强! | CVPR‘26 Oral
上海交大和vivo研究者提出自交换引导(SSG),不依赖文本条件、不加噪声、不改模型,只交换token特征。在多数据集实验中,SSG表现超现有方法。不过,其缺理论支撑、计算开销大。
不让“猪队友”拖后腿!哈深新作 AgentDropoutV2,专治多智能体“传话游戏”翻车现场
多智能体系统中,常有agent出错带偏整体。哈工大联合阿里提出AgentDropoutV2,测试时介入,设‘质检员’审核输出,结合失败案例构建‘避坑指南’,在多测试中显著提效,泛化性强。
谷歌给「AI解数学题」神话降温:能摘低垂果实,但过程依然痛苦
谷歌用Gemini对700个Erdős猜想做攻关实验,推进13个问题。但他们指出,这并不意味着AI能自动做数学研究,其背后核验等成本远超想象,还需警惕‘潜意识抄袭’。
AAAI 2025 Oral | 火山引擎多媒体实验室提出VQ-Insight,AIGC视频画质理解大模型
火山引擎多媒体实验室与北大合作论文《VQ-Insight: Teaching VLMs for AI-Generated Video Quality Understanding via Progressive Visual Reinforcement Learning》入选AAAI 2026口头汇报。VQ - Insight用渐进式框架处理AIGC视频画质理解,实验表现卓越。
AI世界名画复活走秀爆了,全网疯转!梵高达利莫奈同框谢幕,网友哭崩
国外ODDY工作室借助AI让世界名画及角色复活,打造超写实视频《名作艺术秀》。视频中梵高、达利等大师及作品化身“T台模特”,还有“幕后故事”,带来视觉盛宴,引发网友热议。