代码大模型」共找到 9950 篇相关文章

开源动态7

不可思议!400B模型在iPhone上跑起来了

一个跑在 iPhone 17 Pro 的 A19 Pro 芯片上的 400B 模型 Qwen3.5 - 397B - A17B 引发关注。这源于 Flash - MoE 开源项目,它摒弃现代 AI 框架,回归底层开发,实现消费级硬件上模型交互级速度运行。

机器之心
开源动态7

阿里达摩院开源多模态医学模型—灵枢

模型在医疗领域应用有医疗知识覆盖不足、幻觉风险高、推理能力欠缺三难题。阿里达摩院开源统一多模态医学模型灵枢,介绍其数据体系、清洗流程及四阶段强化训练方法。

AIGC开放社区
算法论文8

模型推理也能“智能调度”:让奖励模型按需分配算力的动态路由机制 | ACL 2026

生成式奖励模型(GRM)推理策略存在算力浪费问题。腾讯混元与新南威尔士学联合提出 E - GRM 框架,将模型不确定性定义为调度信号,按需推理。文章从多维度解读该框架,并展示实验评估结果。

InfoQ
开源动态8

模型理解真实医疗视频,全球首个开源技术方案来了!

AI 进入医疗领域需谨慎,此前美国引入不成熟 AI 致手术失误频发。全球首个医疗视频理解模型元智医疗视频理解模型发布并开源,解决了医疗视频领域的任务优化、数据缺失和无法评测痛点。

机器之心
开源动态8

阿里通义开源「推理+搜索」预训练新框架:小模型媲美模型,多个开放域问答数据集表现显著提升

阿里通义实验室开源通用预训练框架MaskSearch,引入检索增强型掩码预测任务,兼容两种训练方法。实验显示,它在多数据集提升模型性能,小模型能媲美模型,还验证了训练方式、策略及奖励函数的效果。

量子位
新闻资讯7

对话地平线前高管牛建伟:万亿参数模型如何重塑具身智能

具身智能赛道分“VLA派”“智驾降维派”和“模型派”。地平线前高管牛建伟认为VLA是弯路,主张用分层架构,以万亿参数“空间智能模型”做脑,VA小模型执行操作,目标是做物理世界的OpenClaw。

AI科技评论
推荐文章8

林俊旸离职后首度发声:万字复盘,模型下一站「智能体式思考」

前阿里千问负责人林俊旸离职后发文,复盘模型行业演进,指出 AI 模型未来主线是智能体式思考。文中分析推理模型崛起的启示,探讨思考与指令融合难题,还阐述智能体式思维含义、强化学习基础设施挑战等。

机器之心
开源动态8

UniPat AI开源SWE-Vision:五百行代码打造SOTA视觉智能体!

多模态模型代码能力进步,但基础视觉任务常失误。UniPat AI开源SWE-Vision框架,让模型用Python代码处理视觉判断。它极简设计,在五个视觉基准测试达最优,提升前沿模型视觉表现。

机器之心
新闻资讯7

先验+后验加持,模型能否 hold 住推理预测的现实「溢出」?

多数模型评估基准依赖固定数据集,难测真实推理实力。字节跳动等推出的 FutureX 动态评测基准,将重点移至动态预测能力。实验显示不同模型在不同任务表现有别,模型在现实场景运用仍待优化。

机器之心
算法论文8

DeepSeek发布最新论文,5杀手锏让模型训练、推理暴涨

全球著名开源模型平台DeepSeek在huggingface发布超强开源模型V3的论文,从硬件架构和模型设计双视角探讨高效训练和推理,提出DeepSeek - MoE、多头潜在注意力等创新技术,解决内存、计算效率等难题。

AIGC开放社区