「大前端」共找到 5153 篇相关文章
o3-pro通关“推箱子”,人类怀旧小游戏成了大模型新Benchmark
推箱子、俄罗斯方块等经典小游戏成大模型benchmark,o3 - pro挑战这两款游戏表现出色,突破benchmark上限,成绩远超o3。Lmgame含多款游戏,有不同评价方式,且开源可用于模型测试。
AMS | 西工大董戴玮、张伟伟等:求解偏微分方程的残差级联极限学习机
本文设计残差级联极限学习机(RC - ELM)缓解极限学习机(ELM)求解偏微分方程的病态问题。将多个ELM块级联,配备相同隐藏层,传递残差求解。实验显示,相比经典ELM,RC - ELM精度优势显著,误差降约4个数量级。
Agent记忆赛道大洗牌!LoCoMo-Refined重磅发布,主流记忆框架迎来核心检验
南京大学与上海人工智能实验室联合推出 LoCoMo-Refined,这是严苛的 Agent 记忆评测基准。它指出当前记忆评测基准有两大漏洞,在其标准下主流记忆框架得分普降,且相关数据集和评测脚本已开源。
ACL 2025 | GALLa:给代码大模型装上“透视眼”,看懂程序的“骨架”!
蚂蚁集团与上海交大合作的 GALLa 研究被 ACL 2025 主会录用。它利用图神经网络将代码图结构信息注入大模型,在 7 个模型和 5 个任务上提升性能,推理与普通 LLM 一致,不增成本。
DeepMind大佬最新暴论:单体大模型穷途末路,未来买的不是模型,是"智能路由"
DeepMind研究员Andrew Trask认为,因Scaling Law对资源需求攀升,AI将成协议而非程序。组合不同厂商模型有优势,当主流榜单同等评分时变革加速,之后人们将买“智能本身”。
神秘模型「Pony Alpha」引外网热议,它会是国产大模型中的谁?
近日,全球模型服务平台OpenRouter上搜索第一的神秘模型「Pony Alpha」引外网热议,它是新一代通用大模型,在多方面表现突出且可免费使用。网友、AI猜测其身份众说纷纭,已有人用它做出惊艳案例。
开盘大涨416%,市值近3000亿元,“国产GPU第一股”今日上市
12月5日,“国产GPU第一股”摩尔线程登陆A股,开盘大涨416%,市值近3000亿。它成立五年成国内代表企业,有全栈自研能力。不过,也面临国际巨头、国内竞品、供应链等挑战,且尚未盈利。
6.1B激活,三榜开源第一!蚂蚁·安诊儿医疗大模型发布
由浙江省卫生健康信息中心等联合研发的开源医疗语言模型AntAngelMed发布。它基于Ling - flash - 2.0,100B总参数仅激活6.1B达约40B密集模型性能,在多个权威医疗基准测评中居前列,采用三阶段训练流程,高效MoE架构。
Anthropic最强网络攻防大模型Mythos,美国国安局早就一直在用了
美国政府准备向多个联邦机构开放Anthropic新模型Mythos的‘修改版’,虽国防部将Anthropic拉黑,但国安局一直在用Mythos。白宫先明确模型接入的权限、用途等边界,再推进接入,各方对其态度有分歧。
人多不管用!智能体团队别盲目扩张,最新综述给出三大维度
随着大语言模型驱动的多智能体系统快速发展,核心问题是有些系统规模扩大后会失稳、低效。美国、英国和澳大利亚研究人员提出三维分类框架描述大规模智能体网络,指出真正决定系统表现的是三种机制组合。