代码大模型」共找到 10028 篇相关文章

推荐文章7

为什么 AI 搞不定体力活——对话清华学刘嘉:这才是生物智能最难攻克的“万里长征” | 万有引力

本文是对清华学刘嘉教授的访谈。他回顾 AI 研究经历,谈 AI 寒冬、研究错误及第一性原理,还分析学术界与工业界差异、AI 现状与挑战,指出模型缺创造力,人应与 AI 共进化。

AI科技大本营
算法论文8

国产芯片比英伟达整体效率更高!?华为 CloudMatrix384 超节点首曝论文,跑 DeepSeek 效率超越英伟达

今年4月,网上曾争论华为芯片效率是否超国际主流。近日华为团队论文公开,阐述在CloudMatrix 384超节点部署DeepSeek模型细节,性能指标超英伟达体系,还介绍架构、软件栈及适配优化方案。

InfoQ
产品应用8

0.3B参数,600MB内存!腾讯混元实现产业级2Bit量化,端侧模型小如手机App

腾讯混元团队推出面向消费级硬件的“极小”模型HY-1.8B-2Bit,参数量仅0.3B,内存占用600MB。它基于产业级2Bit端侧量化方案,生成速度提升,还通过多种方法提升能力,未来将探索新技术缩小与全精度模型差距。

量子位
算法论文8

扩散LLM推理新范式:打破生成长度限制,实现动态自适应调节

随着扩散语言模型成为热门,但其推理时存在预设固定长度的限制。香港中文学 MMLab 等提出 DAEDAL,赋予模型根据问题自主调整回答长度的能力,在性能和计算效率上有提升。

机器之心
产品应用8

快手发布Keye-VL-1.5,同量级SoTA,让模型真正看懂视频!

近年来,多模态语言模型兴起,但视频理解仍是难题。快手Keye团队推出Keye-VL-1.5,通过Slow-Fast编码策略、渐进式四阶段预训练和全面后训练流程等创新,实现视频理解突破,综合性能领先。

深度学习自然语言处理
新闻资讯7

视远·正心明智——机器之心2025年度AI榜单正式启动

2025年人工智能浪潮奔涌,模型快速迭代,催生新应用形态,中国AI发展精彩。机器之心精心策划2025年度榜单,涵盖最强技术实力企业等多个类别,有意企业可扫码申报。

机器之心
产品应用8

GPT-5.2技术炸场!6核心突破,办公效率拉满

OpenAI凌晨发布GPT-5.2,把专业级AI门槛拉到新高度。它有6核心技术突破,精准戳中职场痛点。在GDPval基准测试中表现出色,有三级模型矩阵,不同版本满足不同需求,各方面能力均有显著提升。

CourseAI
新闻资讯7

用得越多、失业越快?GitHub 改 Copilot 规则:默认拿个人代码训练 AI,还搬出 Anthropic 挡枪!

当地时间3月26日,GitHub宣布自4月24日起,Copilot Free、Pro和Pro+用户交互数据默认用于训练AI模型,Business和Enterprise用户除外。GitHub称需更多数据覆盖编码场景,但此举遭用户吐槽。

AI前线
算法论文8

竞赛编程Agent进入全球前十!南、清华新模型CF rating超3500

语言模型在竞赛编程场景易失败。南、清华等研究者提出Solvita框架,由四个角色形成闭环,构建可训练图结构知识网络积累经验。实验显示其在多评测中表现强,提升不靠增加token。

新智元
推荐文章8

NVIDIA技术沙龙 《规模EP优化:PD分离MoE并行方式》课程笔记

本文是NVIDIA技术沙龙课程笔记,介绍规模EP优化的PD分离MoE并行方式。涵盖PD分离、规模专家并行等五项关键技术创新,还对比多模型架构,展示推理服务架构性能特点与优化策略,以及各技术工作流程和效果。

GiantPandaLLM