深度学习模型训练」共找到 8552 篇相关文章

新闻资讯7

模型低价趋势延续!智象未来姚霆:B端、C端界限模糊,API不够、逼出 “按结果付费”

InfoQ 采访智象未来联合创始人姚霆,探讨多模态大模型发展。他指出深度 Scaling up 收益放缓,广度 Scaling up 有惊喜;2025 年模型价格战倒逼厂商加速,低价趋势 2026 年将延续,商业模式转向“按结果付费”。

InfoQ
新闻资讯7

GPT-6 真要来了!OpenAI全新推理架构“循环深度”首次曝光:可榨出14倍参数潜能

OpenAI将推旗舰模型GPT - 6(内部代号Astra),采用“循环深度”新技术,能榨出14倍参数潜能,降低成本,但会使AI推理过程不可读,加重安全担忧。OpenAI已因该模型“能力过强”踩刹车。

InfoQ
开源动态8

给GUI Agent装上「世界模型」:阿里通义用混合数据+统一思维链,让模型学会预判屏幕变化

伴随多模态大模型发展,GUI Agent成人机交互新范式,但构建高可用、跨平台的GUI Agent面临诸多挑战。阿里通义实验室开源Mobile - Agent - v3.5框架及GUI - Owl - 1.5模型家族,解决了相关技术壁垒。

量子位
算法论文8

清华刘洋团队论文:揭示为何 70B 的医疗模型,反而不如 8B 会问诊丨ILCR 2026

在医疗AI领域,模型静态评测与临床问诊能力存在断层。清华刘洋团队提出DOCTOR - R1,将临床问诊建模为POMDP,用强化学习训练。实验验证了其有效性,对医疗AI发展有深远启示。

AI科技评论
算法论文8

北大团队提出 SHINE:将任意文本转化为大模型 LoRA,仅需一次前向传播!

北大团队提出全新超网络架构 SHINE,仅需一次前向传播就能将任意文本转化为大模型 LoRA 参数,支持多轮对话。该方法实用潜力大、架构创新高效,训练流程成熟,推理快速,为大模型持续学习提供新思路。

机器之心
开源动态8

模型即智能体,Kimi K2 Thinking多项评估超越顶尖闭源模型,300轮工具调用不疲倦

月之暗面发布Kimi K2 Thinking,它是Kimi迄今最强开源思考模型,基于模型即智能体理念训练,可自主连续工具调用与多轮思考,多项评估超顶尖闭源模型,还实现原生INT4量化,提升生成速度。

AIGC开放社区
开源动态8

国产类脑大模型适配国产沐曦GPU!长序列推理提速超百倍,仅用2%数据匹敌主流模型

中国科学院自动化所李国齐、徐波团队发布类脑脉冲大模型SpikingBrain (瞬悉)-1.0,借鉴大脑信息处理机制,适配国产沐曦GPU,长序列推理提速超百倍,仅用2%数据匹敌主流模型,探索构建国产自主可控类脑大模型生态。

量子位
开源动态8

别让AI一上来就“进厂打螺丝”:智源悟界·Orca要先教模型理解世界如何变化

智源研究院悟界·RoboBrain Orca Team发布技术报告Orca,探索模型是否理解世界状态变化。Orca尝试在统一世界潜空间学习状态与规律,受海外关注。它先学世界表征,有独特学习方式,经实验验证效果良好。

量子位
算法论文8

IEEE TAP|上海交通大学曹慧琳、南京大学任宇翔等:AI赋能电磁仿真:物理–数据混合驱动的PdEgatSCL模型实现高效建模

为实现电大尺寸目标快速精确建模,本文提出物理 - 数据混合驱动的PdEgatSCL方法,学习CFIE做端到端预测。用EGAT架构,编码格林函数等特征。测试显示它精度高、速度快、省内存,可加速电磁建模与逆向设计。

力学与人工智能
推荐文章8

模型开发实战从入门到入坑:动手写一个MCP Server去理解MCP背后的技术原理

文章聚焦MCP协议,介绍其是规范应用向大模型提供上下文的开放协议,能让模型调用接口更简单、实现开发解耦。还深度解析技术原理,手把手教从0到1实现MCP Server,助读者理解背后技术。

阿里云开发者