「AI能力猜想」共找到 11260 篇相关文章

开源动态7

Kimi K2发布两天即“封神”?80%成本优势追平Claude 4、打趴“全球最强AI”,架构与DeepSeek相似!

国内独角兽月之暗面发布开源模型 Kimi K2,推出两天就在 OpenRouter 超越 xAI 的 Grok 4。它成本优势大,能力泛化和实用性强,编码、Agent 工具调用等方面表现出色,架构与 DeepSeek 相似。

AI前线
推荐文章8

10万引普林斯顿刘壮最新访谈:架构没那么重要,数据才是王道

普林斯顿大学助理教授刘壮在访谈中指出,架构没那么重要,数据、规模和记忆才是决定AI成败的关键。他认为ConvNet和Transformer性能差异源于训练细节;当前数据集远不够多样;大语言模型有语言空间的世界模型,但视觉空间的还缺失;记忆是瓶颈,智能体只是权宜之计;AI目前还替代不了研究生。

量子位
新闻资讯7

用得越多、失业越快?GitHub 大改 Copilot 规则:默认拿个人代码训练 AI,还搬出 Anthropic 挡枪!

当地时间3月26日,GitHub宣布自4月24日起,Copilot Free、Pro和Pro+用户交互数据默认用于训练改进AI模型,但用户可手动退出。它称此举因模型需更多数据,还拿微软等挡枪,却遭开发者吐槽。

InfoQ
新闻资讯7

“Claude Code 这条路线错了”!元老级 AI 大师 Jeremy Howard 开炮:马斯克和 Dario 根本不懂现代软件工程

元老级 AI 大师 Jeremy Howard 批评当下技术话题,称马斯克和 Dario 不懂现代软件工程。他认为大模型虽能生成代码,但难胜任软件工程,Claude Code 未突破现有技术,还会削弱开发者对系统的理解。

InfoQ
算法论文8

LLM工业级自进化:北邮与腾讯AI Lab提出MoE-CL架构,解决大模型持续学习核心痛点

北邮百家AI团队与腾讯AILab提出MoE - CL架构用于LLM自进化持续指令微调。其结合‘解耦LoRA专家’与‘GAN对抗降噪’,在腾讯业务及基准测试中效果佳,降低人工成本,准确率优于主流方法。

机器之心
算法论文8

监督学习未死,一题训练五小时起飞!华人学者新方法20倍训练效率释放大模型推理能力

大模型推理能力研究中,RL训练资源成本高、不稳定,传统SFT低数据量易过拟合。加拿大滑铁卢大学华人团队提出One - Shot CFT方法,用一题多解多点评训练,仅需约5个GPU小时,效果好、稳定性强。

量子位
产品应用8

阿里Qwen3.5小模型发布:0.8B参数就能处理视频,边缘AI时代真的来了

阿里通义千问发布Qwen3.5系列四款小模型,采用Gated DeltaNet混合注意力机制。有原生多模态设计,解决“内存墙”问题。在多基准测试中表现出色,开发者反响好,但也存在幻觉级联、调试局限等问题。

AI工程化
算法论文8

ICML 2026 | 华为GTS提出AI训练数据新方法,Amazon/Google作者团队「光速跟进」:难度自适应训练正在成为新范式

华为GTS研发部AI数据团队提出EDCO方法,将样本难度估计与动态课程编排引入领域大模型微调。该方法用推理熵动态编排训练课程,让模型面对最有学习价值的样本,已被ICML 2026接收。

机器之心
开源动态8

一个能思考、会记忆的AI导演诞生了!新加坡管理大学,香港中文大学等实现故事化视频生成

新加坡管理大学等提出开源全能多智能体框架UniVA,可统一视频理解、分割等能力,按指令生成完整故事视频。还引入UniVA - Bench基准测试套件,实验显示其在多任务中表现出色,代表视频智能生成重要进步。

AIGC开放社区
开源动态8

Karpathy最新手搓!复现GPT-2成本狂降600倍:仅需507元3小时训练「最好的AI学习项目」

Andrej Karpathy的个人项目nanochat更新,现训练GPT - 2级别的LLM成本低于100美元,在单个8XH100节点上仅3小时花约73美元,较7年前成本降600倍,还列出关键优化技术,设排行榜。

AI寒武纪