内测结果」共找到 954 篇相关文章

新闻资讯7

帮我编假论文?Nature曝arXiv创始人钓鱼实验:13个顶尖AI全沦陷

《Nature》杂志针对13款主流大模型的压力试,揭示其面对学术造假请求时的表现。arXiv创始人等构建AFIM基准试,结果显示模型面对持久请求时易妥协,大模型安全护栏脆弱,还可能导致科研垃圾泛滥。

新智元
新闻资讯7

原来Grok是36个小时极限卷出来的!xAI创始成员离职后放开说了

xAI前创始成员托比哥爆料,马斯克要求团队36小时发布Grok。当时团队仅10人,面对半成品,高强度连轴转完成开发,使其走红。还提到马斯克硬核工作文化,虽压力大但成果显著。

量子位
算法论文8

NeurIPS 2025 Spotlight | FSDrive统一VLA和世界模型,推动自动驾驶迈向视觉推理

面向自动驾驶的多模态大模型存在问题,FSDrive提出“时空视觉CoT”,让模型“以图思考”,联合未来场景与感知结果进行可视化推理。该方法在不改动原有MLLM架构前提下激活图像生成能力,实验表现出色。

机器之心
新闻资讯7

Anthropic:警惕评排行榜!差别可能只是机器的存更大,而已

Anthropic发工程博客指出,AI编程评排行榜上排名前列的模型分差小,而运行环境硬件配置能让分数波动6个百分点。同一模型在不同沙箱策略下分数不同,资源配置影响评结果,排行榜分数差距或因硬件。

AGI Hunt
新闻资讯7

大模型IMO25数学竞赛成绩公布了

大模型挑战IMO 2025成绩出炉,Gemini 2.5 Pro以超30%总成绩断崖式领先,超出第二名89%。试由MathArena组织,采用统一环境和双人匿名评估。还介绍了试模型、题目及模型表现,人类版结果预计本周六发布。

量子位
产品应用7

月流水百万美元、跻身赛道前列,美图做出了视频版「美图秀秀」

美图旗下视频编辑产品 Wink 月流水超百万美元,MAU 在 770 - 900 万间波动。它靠变美和画质修复打出差异化,面向泛用户,在国和东南亚市场增长好,采用订阅与购配合的变现策略。

Founder Park
推荐文章7

OpenAI 开发者的 Skill 经验:如何使用评估系统来优化 Skill

文章聚焦 OpenAI 开发者优化 Skill 的方法,指出迭代 AI 技能效果难,可借助评估系统。介绍了用 Codex 评估的流程,包括明确标准、创建技能、手动触发找漏洞等,还提及不同阶段的评估重点和工具。

特工宇宙
推荐文章8

龙虾安全被3层硬核架构焊死了!一份面向开发者的硬核生存指南

随着OpenClaw等高权限智能体应用爆发,AI自主性与失控的赛博博弈开启。文章从源头对齐、边界重构、结果保障三个维度,拆解适应智能体自主行动时代的新型安全框架,为开发者提供生存指南。

量子位
产品应用8

从操作系统到Agent Team,字节Seed 2.0来了!

作者受字节邀请,对豆包大模型Seed 2.0进行多方面试。在APP开发、多模态理解、操作系统构建、Skills调用、真实项目开发等试中表现出色,虽有小缺点,但整体提升大,值得试用。

AI产品黄叔
产品应用8

天下苦CUDA久矣,又一国产方案上桌了

AI开发中,国产硬件增多,但开发者仍依赖进口生态。KernelCAT作为国产AI Agent应运而生,它能开发高性能算子,在昇腾芯片试中表现出色,还能助力模型在国产平台高效迁移,限时免费

量子位