「新版图灵测试」共找到 5002 篇相关文章
AI七个月突破数学家“围剿”反超人类!14位数学家深挖原始推理token:不靠死记硬背靠直觉
大模型o3 - mini - high在7个月内,于FrontierMath基准测试中,答题得分从2%提升到22%,超人类团队平均水平。数学家分析其推理记录,发现它靠直觉而非死记硬背解题,但也存在缺乏创造力等局限。
时隔一年,再次使用7个国产AI大模型写高考作文,国产模型的进步也太大了!有彩蛋。
去年评测国产模型写高考作文能力时,各模型问题不少,如用词重复、字数不足。今年再次测试7个国产模型,能力有指数级提升,文采惊人,扣题方面通义千问和文心一言表现出色。文末还有海外模型“翻车”彩蛋。
对普通人最有用的一次!藏师傅教你用FLUX Kontext解决一切图片问题
黑森林工作室发布生成式流匹配模型 FLUX Kontext,它能编辑图片且不影响未编辑区域,支持多图参考生成新图像。可用于去水印、修复照片、修改海报、生成商品展示图等,还能美颜美体,替代 PS 等工具。
独家!哈工大斩获AI顶会ACL评审阶段最高分,让AI领略汉字之美
哈工大论文获AI顶会ACL 2025评审阶段已知最高分。团队用传感器捕捉手部书写实现汉字输入识别,独创中文字形编码让AI理解汉字形态,革新中文人机交互,推动汉字文化传承,为AI理解汉字开辟新路。
DeepSeek 跃居全球第二 AI 实验室,中美正式并驾齐驱!
Artificial Analysis宣称DeepSeek R1跃居全球第二,其0528版得分达68分,与Google Gemini 2.5 Pro并列。更新体现强化学习的重要性,多家云服务提供商也迅速支持新模型,这表明开源与闭源模型差距缩小,中美AI并驾齐驱。
多模态大模型不会画辅助线?最新评估得分:o3仅25.8%,远低于人类82.3% | 清华腾讯斯坦福联合
清华、腾讯、斯坦福等团队发布RBench - V基准测试,评估大模型视觉推理能力。结果显示,主流大模型如o3、Gemini2.5等准确率远低于人类,开源模型表现更差,暴露出大模型在复杂多模态推理任务中能力不足。
又一个开源 AI Agent 杀到!II-Agent,号称“全球最强”,击败 Genspark 和 Manus,跑分直逼人类
AI Agent 赛道迎来新成员 II-Agent,由 Intelligent Internet 团队打造且将开源,获前 Stability AI CEO 站台。它性能强、可扩展,GAIA 跑分亮眼,团队认为未来是 Agent 群的天下,还计划为多领域构建开源 Agent。
揭秘台积电未来战略核心——晶圆级系统集成
上周台积电研讨会公布2026 - 2028年技术路线图,其晶圆级系统集成技术SoW有新进展。半导体正从单一制程向系统级整合转型,台积电以制程与封装双轨驱动定义规则,还面临高成本等挑战。
盘点丨那些 AI 公司悄咪咪上线的产品(十五)
本期盘点快手、字节、百度新上线的 AI 产品。快手的 Poify 是电商场景 AI 图像编辑产品;字节的 Pippit 是全链路内容制作平台,功能成熟丰富,拿下 ProductHunt 4 月月榜第一;百度的月匣是 AI 虚拟陪伴产品。
从实验室到工厂:具身智能如何跨越商业化的“死亡谷”?|甲子引力X
4月28日「AI共潮生——2025甲子引力X科技产业新风向」大会上,五位嘉宾围绕具身智能分享见解。当前行业处概念到商用过渡期,梅卡曼德邵天兰等四位机器人领军人物探讨商业化路径,指出需聚焦场景、降成本、强技术可靠性。