「实际暴露度」共找到 622 篇相关文章
GPT-5编程测评大反转!表面不及格,实际63.1%的任务没交卷,全算上成绩比Claude高一倍
Scale AI的新软件工程基准SWE - BENCH PRO测试中,‘御三家’表面解决率低。深入看,GPT - 5已提交任务准确率比Claude高一倍。该基准新题多、更复杂,能真实考验模型能力,当前模型解决商业问题能力有限。
刚花完天价抢人,如今态度180度转变说AI泡沫?Meta冻结招聘遭网友群嘲:小扎翻脸比翻书快
近日,Meta 冻结 AI 招聘,此前它刚花巨资从对手处挖人。原因是 CEO 扎克伯格担心投资无回报,且公司在重组。此前 Meta 计划投数千亿美元建数据中心,其 Behemoth 模型发布推迟。此外,报告称 95% 公司 AI 投资零回报。
AI 眼镜“秒变”直男程序员“脱单神器”,首次亮相被抢购一空!CEO 坦言:好产品要么能帮用户赚钱,要么能解决实际痛点
拂曦科技CEO段然分享AI眼镜创业经历。AI眼镜行业发展有趋势也有瓶颈,拂曦科技从B端转C端,其恋爱眼镜首秀被抢空。还谈到技术挑战、市场教育及未来爆款场景,强调场景是核心竞争力。
grok 4一图流
文章展示grok 4核心数据,涵盖训练成本、模型定价,还列举其在通用、专业、数学、推理、编程等能力测试中排名第一的成绩,不过实际水平还有待观察。
博士生,当代最穷科研民工?Nature最新调查:不涨工资,我们就跑路了
Nature公布对全球3785名博士调查,结果喜忧参半:满意度回升,但薪酬与指导拖后腿;AI使用普遍,不过多数人不信任其输出结果;骚扰与偏见问题严重,心理健康告急。
25%年轻人都想和AI谈恋爱!美国最新调查:男性比女性更想要AI朋友
美国针对2000名40岁以下成年人调研发现,约11%愿有AI朋友,25%可接受与AI恋爱。男性、自由派、网瘾大的年轻人接受度高。多数人对AI影响看法两极分化。
极客部落“OPC 创业者招募计划”正式启动 —— 携手朝阳区赋能 AI 时代独角兽,助推人才高质量发展
北京市朝阳区多部门与极客邦共同发起“极客部落·AI 应用生态园”及“OPC 创业者招募计划”,为创业者提供全方位加速支持。“朝阳青创十五条”涵盖多维度政策,3 月 20 日还有创业开放日活动。
走出 MMLU 的高分幻觉:AI Agent 的「斯坦利时刻」与职场生存法则
文章指出多模态大模型在基准测试分数高,在实际业务流程却像‘职场巨婴’。研究团队构建Trainee - Bench测试顶尖模型,结果显示模型离‘独立上岗’远,凸显提升Agent自主学习性的重要性。
谷歌悄咪咪上线了 10 款 AI 应用,下一个 NotebookLM 可能在里面
谷歌在Google Labs上线10款AI应用,如Whisk生图、Mixtape将名画变音乐、Food Mood定制食谱等。不少项目虽处实验阶段,但完成度和可玩性高,还展现了谷歌在AI领域的探索与创新。
马斯克输了!告OpenAI被驳回,原因是告晚了
2026年5月18日,“马斯克起诉OpenAI”案裁决,OpenAI无需担责,马斯克诉求被驳回,原因是诉讼时效已过。官司拉扯两年多,索赔追加到1340亿美元。庭审暴露双方问题,后续资本战或开启。