「模型训练难题」共找到 8705 篇相关文章
企业软件底层逻辑脱胎换骨:从席位订阅到决策订阅,下一个万亿公司属于这类玩家
大模型落地进入深水区,企业级软件底层逻辑发生“脱胎换骨”变化。以特赞提出的GEA架构为例,企业软件竞争从模型能力转向认知结构,价值结构、引力中心等都在改变,软件订阅也从席位转向决策。
一年前让英伟达蒸发6000亿,一年后被老黄搬上PPT
北京时间1月6日,黄仁勋在CES 2026上展示Kimi K2、DeepSeek V3.2、Qwen等中国模型。此前英伟达因谷歌、Meta等对手的冲击市值蒸发。老黄花200亿美元挖人,用中国开源模型反击,构建开放生态。
Kimi K2 Thinking突袭!智能体&推理能力超GPT-5,网友:再次缩小开源闭源差距
Kimi K2 Thinking发布并开源,主打“模型即Agent”,能边思考边用工具,连续工具调用200 - 300次。在多评测基准超GPT - 5等闭源模型,代码权重遵循MIT协议,可在官网和应用实测。
在救命这件事上,AI开始做医生做不到的事了。
达摩院与医院合作,此前推出用于胰腺癌、胃癌早筛的模型。此次浙大一院与达摩院联合开发的iAorta模型,用普通平扫CT精准识别主动脉综合征,大幅缩短确诊时间,从死神手中抢回生命。
月之暗面刚开源多模态Kimi-2506:智能体、视觉理解,重磅大升级
国内月之暗面平台对开源多模态模型Kimi-VL-A3B-Thinking升级到2506版本。该版本性能、视觉理解等能力提升,支持更高分辨率,在多领域表现出色,还介绍了模型组成与优化器改进。
推理“刹不住车”?新框架让DeepSeek-R1们告别过度思考,已开源
DeepSeek - R1等推理模型能力增强,但出现过度思考问题,如步骤繁冗、表述拖沓、输出冗长。浙大等团队提出Self - Braking Tuning(SBT)框架,能让模型适时终止推理,在多数据集测试中效果显著。
条条电路通罗马:大模型可解释性的「唯一机制」可能从一开始就不存在
长期以来,机制可解释性领域默认模型对同一任务的能力对应唯一内部「电路」。但被ICML 2026接收的新论文指出,「唯一电路」可能不存在,同一任务可由多个结构不同但能力相当的电路完成。
陶哲轩联手GPT-5,1小时攻克数学难题!全程无需编码,OpenAI副总惊呼
陶哲轩联手ChatGPT攻克MathOverflow复杂数学题,节省数小时编码时间。他先让ChatGPT生成代码,后改用分步对话找参数,还验证结果。AI助其发现错误、优化流程,凸显在数学研究的潜力。
美国开源被中国甩在身后,套壳创业者更遭惨烈清算!OpenRouter CEO:天天乱用高价AI的员工要小心了
顶级科技播客20VC访谈OpenRouter联合创始人兼CEO Alex Atallah。他指出美国开源大模型落后中国,企业怕依赖巨头,AI时代员工成本应动态化,还探讨了模型生态、路由技术等行业热点。
阶跃星辰豪揽超50亿融资,“天才创始人”印奇重掌帅印
通用人工智能公司阶跃星辰完成超50亿元B+轮融资,刷新中国大模型领域单笔融资纪录。同时,印奇出任董事长。该公司坚持“基础大模型”与“AI+终端”战略,商业化探索也在多方向推进。