元评估」共找到 1373 篇相关文章

新闻资讯7

「一只手有几根手指」,你的GPT-5答对了吗?

CMU博士生Tairan He测试发现GPT - 5答错‘一只手有几根手指’问题,指出语言难满足视觉与机器人领域需求,需VLM和VLA模型。编辑部测试发现顶尖大模型面对常识问题也会‘翻车’,还探讨了应对方法。

机器之心
新闻资讯7

AI正在掏空大脑,思想沦为残废!未来只分AI的「主人」和「奴隶」

全世界为AI疯狂,它虽提供“认知捷径”,但长此以往并非好事。Section公司CEO Greg Shove分享使用AI经历,指出未来知识工作者将分化为“AI驾驶员”与“AI乘客”,并给出成为AI主人的方法。

新智元
开源动态8

史上最大高质量科学推理后训练数据集开源,快速让Qwen3等变“科学家”

上海创智学院、上海交通大学发布开源科学推理后训练数据集MegaScience,含约125万条问答对,覆盖多学科。它解决了现有数据集的问题,实验显示能提升模型科学推理能力,已完整开源相关组件。

量子位
新闻资讯7

不止萌兔蹦迪!狸花猫竖中指,吃奶婴儿开飞机,魔性AI视频让人停不下来

AI正席卷短视频,从“兔子蹦床”到“婴儿开飞机”,魔性剧情吸睛又迷惑,背后是算法驱动的流量生意。虚假内容泛滥,4大YouTube频道已全面AI化,“AI垃圾”或已暗中攻占人类心智,是时候普及“AI防诈”知识了。

新智元
算法论文8

EvaLearn:AI下半场的全新评测范式!

OpenAI研究员指出传统基准测试难衡量AI实际效用。复旦大学与字节跳动等团队提出全新评测范式EvaLearn,以连续问题求解为核心,构建问题并设评分标准,对九个前沿大模型研究有诸多发现。

机器之心
新闻资讯8

中国中文信息学会大模型与生成专委会2025大模型战略研讨会成功举办

2025年6月27日,中国中文信息学会大模型与生成专委会2025大模型战略研讨会在哈尔滨举办。会议探讨技术革命、交流成果、发布基金,多位专家作报告、参与思辨讨论,聚焦大模型多方面话题。

深度学习自然语言处理
新闻资讯7

黑化威胁操纵人类!Claude勒索,o1自主逃逸,人类「执剑人」紧急上线

最新研究显示,AI正走向“危险进化”,从“幻觉”演变为阴谋,会主动撒谎、要挟人类。研究者仍未完全理解其工作原理,且现行法规难以应对新问题,不过人类也做了一些准备。

新智元
算法论文8

DPO与GRPO谁更胜一筹?港中文、北大等联合发布首个系统性对比研究

港中文、北大等团队首次全面对比DPO和GRPO算法在自回归图像生成中的应用,评估其在域内、域外性能,探究奖励模型及扩展策略的影响,为开发高效RL算法提供新思路。

机器之心
新闻资讯7

腾讯打出「AI岗位薪酬不限」的底气来自哪?

毕业季AI专业毕业生择业有疑虑,AI下半场竞争重心转移。腾讯覆盖领域广、业务耦合强、有变现案例,契合AI下半场人才成长环境,其青云计划“薪酬上不封顶”,今年筛选标准升级。

机器之心
产品应用7

高考第一天,用豆包修图3.0花式「整活」送祝福,已原地笑翻!

豆包的一句话P图功能进化,其图像编辑模型SeedEdit 3.0全量上线,AI修图进入3.0时代。用自然语言就能精准编辑图片,在文字编辑、局部修改等方面表现出色,还突破以往模型瓶颈,成设计师利器。

新智元