「人类第一视角数据」共找到 1625 篇相关文章
机器人交税养打工人!奥特曼AI新政曝光,上4休3要成真?
OpenAI奥特曼预警超级智能将至,带来巨大冲击。OpenAI抛出13页政策文件,核心提案有建立AI公共财富基金、试点4天工作制、对机器人征税、给“人类专属”工作涨薪,虽多为探索性提案,但信号值得关注。
大模型IMO25数学竞赛成绩公布了
大模型挑战IMO 2025成绩出炉,Gemini 2.5 Pro以超30%总成绩断崖式领先,超出第二名89%。测试由MathArena组织,采用统一环境和双人匿名评估。还介绍了测试模型、题目及模型表现,人类版结果预计本周六发布。
独家 | 乐聚发布垂域具身模型:一倍工业提效,两项榜单第一
AI科技评论独家获悉,乐聚机器人将推出面向工业场景的“垂域具身智能模型”——KUAVO VLA,该模型用600+小时真机数据进行中训练,能提效且减少适配与训练成本,两项指标排名第一,利好二次开发者。
谷歌Deep Think八语奥赛屠榜!自主攻克4大未解难题,科研壁垒崩塌
谷歌Deep Think横扫亚欧多语种竞赛,成绩亮眼。虽评测数据来自内部,未公开细节且是区域赛,但它定位为‘人类智力倍增器’,其驱动的Aletheia已产出论文,解决4个未解问题,在多领域展现潜力。
直播预约 | 如何缓解LLM-as-a-Judge的潜在偏好?UDA:一种无需人工标注的无监督去偏对齐框架
论文针对不同大模型对同一组大模型回答打分差异大等问题,提出无需人工标注、模型无关、即插即用的UDA框架,以无监督方式动态调整Elo评分,实验表明该方法能降低打分标准差、提升与人类评分相关系数。
Andrej Karpathy深度解读:强化学习之父为何说大模型违背了「苦涩教训」
Andrej Karpathy深度解读Sutton与Dwarkesh的播客对话。Sutton认为大模型不符合「苦涩教训」,因其训练依赖人类数据集。他追求类似动物通过强化学习与世界交互的系统。Karpathy认可批评,认为找到符合原则算法是突破。
盘点丨那些 AI 公司悄咪咪上线的产品(十五)
本期盘点快手、字节、百度新上线的 AI 产品。快手的 Poify 是电商场景 AI 图像编辑产品;字节的 Pippit 是全链路内容制作平台,功能成熟丰富,拿下 ProductHunt 4 月月榜第一;百度的月匣是 AI 虚拟陪伴产品。
OpenAI夺金IOI,但输给3位中国高中生
OpenAI官宣其推理模型在今年IOI线上竞赛中成绩刷新纪录,总分533.29,全球330名人类选手中排第六,AI参赛者中居首。不过其没比过三位中国高中生。此前OpenAI称模型获IMO金牌引争议,此次网友更谨慎。
“连我也要被GPT-5踹了!”Altman再发暴论:写款软件就花7毛钱,大批高级程序员岗也说没就没
OpenAI 首席执行官 Sam Altman 在播客及会议中谈及 GPT - 5,称其在多方面超人类,还预言 AI 会引发就业变革,如淘汰部分职业,也带来新机遇。同时指出 AI 虽益处大但风险高,如欺诈危机。
挤干大模型高分「水分」!最强模型仅49分,南大傅朝友发布Video-MME-v2
南京大学傅朝友团队在 Google Gemini 评测团队邀约下推出视频理解新基准 Video-MME-v2。它有创新的分层能力体系与组级非线性评分,揭示模型与人类的巨大鸿沟、传统 Acc 指标虚高、“Thinking”并非总是增益等现象。