「Iceberg V3」共找到 2366 篇相关文章
Sutton、OpenAI 联创押注的持续学习,有中国团队带着模型进场了
7 月,TML 发布 Inkling 模型,Mind Lab 发布 Macaron V1,二者均针对持续学习场景。持续学习走「参数空间的迭代」路线,让模型用得越多越好用。硅谷已有不少新尝试,产业链正在形成。
ACL 2026 | 中科大&上海AILab揭示强化学习后训练的Scaling Law
中国科学技术大学和上海人工智能实验室等团队,在Qwen2.5和Llama 3模型开展研究,揭示强化学习后训练的Scaling Law,提出幂律公式预测模型学习效率与训练轨迹,成果被ACL 2026接收。
个人开发者训400亿参数大模型:分布式算力,DeepSeek架构,3090单卡部署
Nous Research推出Psyche Network,可整合全球算力训练AI。它基于Deepseek的V3 MLA架构,有DisTrO优化器等技术,能让个人和小团体创建大规模模型,还实现40B参数LLM预训练。
谷歌:全栈AI之王
随着Gemini 3模型与第七代TPU的发布,谷歌打破OpenAI与英伟达主导的市场叙事。其全栈AI战略从底层基础设施到用户产品全覆盖,TPU进化、软硬件契合,吸引大客户,C端产品成发展引擎。
中兴星云拿下推理总分榜一!SuperCLUE 5月成绩出炉
2025年全球AI大模型竞赛激烈,SuperCLUE发布5月报告,中兴通讯星云大模型Nebula Coder - V6推理专项榜单总分并列第一、总榜并列第二,细分赛道表现佳,且是少数获国家级权威安全认证的大模型。
最新!Karpathy:Vibe Coding只是抬高了地板,真正的战场在这里
Andrej Karpathy在AI Ascent 2026上与红杉合伙人对话,分享自提出“vibe coding”一年来的变化。谈到技术转变、Software 3.0、模型“锯齿状”特征等,还区分了vibe coding和agentic engineering,指出人类需保留品味、判断力等。
刚刚,DeepSeek又探索新架构了,开源OCR 2
DeepSeek更新DeepSeek - OCR 2,引入DeepEncoder V2架构,实现视觉编码范式转变。模型和技术报告齐开源,在多项测试中表现出色,降低重复率,为全模态编码提供路径,但在报纸类文档识别有不足。
语音模型也能“freestyle”?可定制角色,模拟背景音
阿里新推两款语音模型,Fun - CosyVoice3.5可基于参考音频克隆声音,优化多方面能力;Fun - AudioGen - VD能进行‘从无到有’音色设计,并模拟复杂听觉环境。用户即日起可在阿里云百炼调用。
国产芯片也能跑AI视频实时生成了,商汤Seko 2.0揭秘幕后黑科技
自Sora 2发布,科技厂商掀起视频生成模型竞赛。12月15日商汤上线Seko 2.0,实现AI短剧‘一人剧组’。其背后的LightX2V框架做到实时生成,还适配国产芯片,有望推动视频创作生产力革命。
你敢信?GPT-5的电脑操作水平只比人类低2%了
Agent S3刷新了计算机使用智能体(CUA)在「OSWorld」基准测试的记录,性能达69.9%,接近人类水平。它引入bBoN实现并行扩展,还精简框架、引入原生代码智能体,已开源并发布论文。