「大素数空隙」共找到 5059 篇相关文章
用「进化+压力测试」自动生成的竞赛级编程题,各家大模型谁更hold住?
北京大学与通用人工智能研究院联合提出 UniCode 框架,构建进化式评测系统,能自动生成高质量算法题目与抗污染测试用例。通过对 19 个前沿大模型测试,展现高挑战性与强判别力,为代码能力评估开辟新路径。
老黄玩Nano Banana上瘾,拉着哈萨比斯大夸特夸,“不会有人不喜欢吧?”
英伟达CEO黄仁勋公开宣称是Nano Banana的忠实粉丝,还向DeepMind CEO哈萨比斯大夸特夸。他也常用多种AI工具处理事务,提升效率。Nano Banana有新玩法,让Gemini走红,拉下ChatGPT下载量榜首。
印度国家级大模型上线两天仅 300 余次下载,投资人直呼“尴尬”:韩国大学生模型都有20万!
印度 Sarvam AI 发布国家级模型 Sarvam - M,虽被赞为本土 AI 研究突破,支持 10 种印度本地语言,但上线两天仅 334 次下载,投资人批评其成果‘令人尴尬’,引发社区激烈争论。
新天终启,万象智生!从AlphaGo到GPT-5,新智元十年见证ASI创世纪
2025年9月7日新智元举办十周年峰会,主题为「新天终启,万象智生」,汇聚多位重量级嘉宾探讨AI前沿突破。当下AI发展迅猛,大模型密集发布,如OpenAI的GPT - 5、谷歌的Gemini 2.5等,中国造大模型也在开源领域领先。
EMNLP25 | "大模型在环"技术新突破:Dial-In LLM 推动中文客服意图聚类新范式
本文提出LLM-in-the-loop意图聚类框架,以传统聚类为骨架,微调后的中文LLM做语义裁判和命名批注。在10万+真实客服通话数据集上超越基线,解决现有方法依赖词向量、缺乏可解释性、调用大模型成本高的问题。
智谱终于发布GLM-4.5技术报告,从预训练到后训练,细节大公开
上个月底智谱开源 GLM-4.5 及轻量版,成绩亮眼引热议。现其技术报告发布,详述预训练到后训练细节,还介绍了开源 RL 框架 slime,展示模型架构、训练阶段等,评估了在多任务上的表现。
OpenAI o3封王,4比0横扫马斯克Grok 4!全球大模型对抗赛完美收官
Kaggle AI国际象棋锦标赛中,OpenAI o3以4-0横扫Grok 4夺冠,这场比赛也被视为OpenAI与xAI的“代理人战争”。季军战里,Gemini 2.5 Pro击败o4 - mini获铜牌。大赛旨在检验大模型多方面能力。
机器人是具身大模型的「用户」:超维动力如何打通从人类经验到机器人行动?
今年WAIC,超维动力展台的乒乓球桌和双臂机器人开易拉罐演示吸引关注。其机器人90%经验来自人类第一视角数据,超维动力全栈布局,试图打通人类经验到机器人行动链路,目标是建立机器人持续进化方式。
港科大教授实测AI眼镜“作弊”:30分钟碾压95%的学生,把传统教学评估体系整破防了
香港科技大学教授团队让搭载ChatGPT - 5.2的乐奇AI眼镜参加《计算机网络原理》期末考,30分钟得92.5分超95%学生。此测试暴露AI眼镜功耗和清晰度问题,也引发对传统教学评估体系的反思。
缔造OpenAI的秘密,竟只有一个词!新智元十年峰会圆桌,七位大咖激辩
新智元十周年圆桌论坛上,七位嘉宾探讨通往AGI与ASI的关键问题,如智能核心、AI能效、游戏与AI关系等。他们认为AI发展超预期,语言是智能核心,实现ASI关键在能耗,还谈及芯片与人脑差距、物理世界发展慢等话题。