机器学习模型」共找到 8392 篇相关文章

新闻资讯8

LLM近期重大架构进化一览:从Gemma 4到DeepSeek V4

近期大模型长上下文需求增长,成本问题凸显。Google Gemma 4、Poolside Laguna XS.2、Zyphra ZAYA1 - 8B、DeepSeek V4 等模型各有架构优化,如 Gemma 4 跨层 KV 共享和 PLE,以降低长上下文推理成本。

机器之心
开源动态8

刚刚,DeepSeek多模态技术范式公布,以视觉原语思考

DeepSeek发布多模态模型并公布技术报告,提出‘以视觉原语思考’。该模型解决多模态大模型‘指代鸿沟’问题,有把坐标变思维单元、7056倍视觉压缩、精心设计冷启动数据等创新,实验在多任务上超主流模型

机器之心
推荐文章8

这大概是我见过最通俗易懂的AI发展历程科普详文了

文章从历史时间线出发,介绍AI诞生、发展历程,涉及细分技术模块。结合案例说明AI在不同阶段的应用,如早期机器翻译、垃圾邮件过滤。还探讨AI大模型、智能体等概念,分析调优方法和‘幻觉’问题,展望其未来前景。

腾讯技术工程
推荐文章8

让AI自我进化,斯坦福新课免费教

斯坦福开设新课CS329A《自我进化AI智能体》,被奉为Agent学习新晋资源宝库。课程由实战派教授授课,介绍扩大模型规模、养成能听懂人话的AI、提升AI能力等内容,还探讨AI自我改进及智能体工作流等。

量子位
新闻资讯8

MLLM集体翻车,缺乏婴儿级常识!业界首个核心认知基准发布,LeCun转赞

当前大模型在12项核心认知上普遍落后人类10 - 30%,越大的模型越易靠「背答案」糊弄。团队公开首个系统评测框架和题库,用Concept Hacking方法识破模型真假理解,指出模型存在核心知识缺失等问题。

新智元
开源动态8

百度Qianfan-VL开源,纯国产自研昆仑芯跑出世界一流

百度开源全新视觉理解模型Qianfan-VL,有3B、8B和70B三个版本,在昆仑芯P800芯片上训练。该模型多模态能力强,OCR和教育场景表现突出,跑分超国际主流模型。芯片功耗低、架构优,模型训练方法创新。

AIGC开放社区
算法论文8

PPO-Clip的「盲点」被补齐了?快手提出熵比裁剪方法,从局部约束到全局稳定的关键一跃

快手科技语言大模型团队提出熵比裁剪(ERC)方法,应对强化学习中信任域偏离问题。该方法从全局视角稳定策略分布,在多个数学推理基准实验中提升了模型性能,还与多种方法对比验证了泛化能力。

机器之心
算法论文8

27M参数战胜GPT-4!脑启发的分层Reasoning引擎如何重塑LLM

当前大语言模型(LLM)核心架构存在根本性缺陷,受大脑分层处理和多时间尺度启发,本文提出仅2700万参数的分层推理模型(HRM),免预训练与CoT标注,单次前向传播解决复杂任务,在ARC - AGI上超越GPT - 4等LLM。

深度学习自然语言处理
算法论文8

AAAI 2026 Oral:明略科技开创稀疏数据「信息瓶颈动态压缩」,精度+速度双SOTA

机器人和具身智能领域,transformer模型又大又‘重’,边缘设备难以承受。东南大学、中南大学、明略科技联合提出的CompTrack论文,创新性解决AI模型处理稀疏数据的‘双重冗余’,在3D点云跟踪任务上实现精度和速度双优。

机器之心
产品应用8

VLA进化后降维打击!双手拣货,漂移操作,还能批量化秀舞,太空舱直接开上街,被银河通用卷到了

世界机器人大会上,银河通用的人形机器人Galbot在具身智能小卖部营业,背后是自研端到端具身智能大模型。其与英伟达联合首发的机器人应用表现出色,太空舱也在北京首发,适配多场景,具身大模型商用能力获认可。

量子位