「AI能力提升」共找到 12354 篇相关文章
从deepseek v4的受限流线型超链接mHC谈架构优化
文章围绕DeepSeek v4的受限流线型超链接mHC探讨架构优化。指出过去十年深度学习重扩展层内计算,忽视层间通信。介绍多种层间通信改进方法,提出用检索替代累加,还提及深度注意力机制及混合深度注意力的成果。
震惊海外开发者!BOSS直聘3B小模型比肩80B,怎么做到的?
BOSS直聘楠北阁团队发布3B轻量端侧小模型Nanbeige4.1-3B,性能震惊海外开发者。团队从多方面改进,如优化推理和偏好对齐,重构训练数据,采用多种强化学习算法,使其性能比肩大模型。
清华联手千问重塑归一化范式,让 Transformer 回归「深度」学习
Pre - Norm和Post - Norm是Transformer架构中稳定信号流的关键范式,但面临权衡取舍。近日,清华黄高团队联合千问团队提出SiameseNorm,构建参数共享的平行通路,实现稳定训练并提升性能。
DeepSeek V4爆春节登场!四大杀招突袭全球编程王座,Claude危
据爆料,DeepSeek计划在2月中旬春节前后发布V4模型,剑指编程王座。其在编程能力、超长上下文代码处理、算法提升、推理能力上有突破,或延续高性价比路线,在受限硬件下靠算法取胜。
小模型,大能量!200美金的GPT Pro竟然输给了它?
博主用11个场景深度测试昆仑万维的Skywork R1V4 - Lite,它能做到Gemini 2.5 Pro才能干的事,速度快、成本低。在定位、人物识别、生活实用、专业鉴定、学术研究等场景表现出色,核心突破在于主动图像操作与深度推理。
机器人“会用手”了!银河通用首破手掌任意朝向旋转难题,拧螺丝、砸钉子样样精通
银河通用推出的灵巧手神经动力学模型DexNDM,让灵巧手实现从能动到能用的飞跃。它首次突破手掌任意朝向旋转难题,实现跨物体、跨姿态稳定操作,助力机器人迈向精细操作,推动灵巧操作走向生产力基础设施。
超越纯视觉模型!不改VLM标准架构,实现像素级深度预测
Meta开源DepthLM,首证视觉语言模型不改架构就能媲美纯视觉模型的3D理解能力。通过视觉提示等创新策略,它精准完成像素级深度估计等任务,为多领域带来前景。
Python新版本去GIL刷屏,Karpathy 点赞敢死队,Python 之父:冷静,别神话并发
Python 3.14 正式发布,将“去 GIL”写进官方发行版,带来自由线程支持等能力,预估性能提升 3% - 5%。开发者看好,Karpathy 点赞,但 Python 之父认为去除 GIL 重要性被高估,强调工程常识。
陶哲轩联手GPT-5,1小时攻克数学难题!全程无需编码,OpenAI副总惊呼
陶哲轩联手ChatGPT攻克MathOverflow复杂数学题,节省数小时编码时间。他先让ChatGPT生成代码,后改用分步对话找参数,还验证结果。AI助其发现错误、优化流程,凸显在数学研究的潜力。
390亿美元,全球具身智能第一估值来了!英伟达持续加注中
与OpenAI分道扬镳后,Figure C轮融资获超10亿美元承诺资本,投后估值达390亿美元。资金将用于扩大人形机器人大批量制造与部署、搭建GPU基础设施、启动数据采集项目,助力具身智能发展。