「端到端学习」共找到 3475 篇相关文章
不死的程序员
文章回顾计算机技术演进中八次“程序员替代论”浪潮,从编译器诞生到如今大语言模型崛起。虽每次都预言程序员被取代,但实际是角色重塑、分层,新需求增长超人力节省,程序员价值仍在。
超越GPT-5.2和Gemini-3-Pro!商汤多模态搜索、推理模型开源
商汤开源多模态自主推理模型SenseNova - MARS(8B/32B双版本),它通过强化学习整合工具,在多模态搜索与推理测试中超越Gemini - 3 - Pro与GPT - 5.2,还采用创新算法稳定训练,构建新基准评测。
Mistral 3开源,一举超越DeepSeek与K2?
近期,Mistral AI开源Mistral 3,含三款小型稠密模型及Mistral Large 3。Benchmark对比中,它领先国内DeepSeek - 3.1、Kimi - K2。Mistral Large 3是强开源权重模型,Ministral 3适合边缘端,成本性能比低。
“同事.skill”不用写了,爱马仕 Hermes 主动“蒸馏”你,还让开发者集体抛弃 “龙虾”?!
近日,Hermes Agent 在国内爆火,获超 5.2 万 stars 且还在增长。它与 OpenClaw 不同,采用单 Agent 架构,有学习循环和分层记忆系统。背后公司 Nous Research 目标是打造抗衡 OpenAI 的开源模型,还引入区块链解决算力问题。
AI真的能读懂人心吗?阿里通义最新研究成果揭示答案
文章聚焦多模态推理问题,如全局上下文理解不足和推理捷径问题。介绍阿里通义HumanOmniV2改进方案,涵盖全局上下文理解等方面,还详述冷启动、两阶段强化学习训练方案及数据集下载和训练方法。
斯坦福意外用AI生成超强CUDA内核,性能比人类专家优化得还要好!翻倍碾压原生PyTorch,华人主创
斯坦福团队意外发现AI生成的内核性能超人类专家优化的,在常见深度学习操作上能让性能提升近400%。其方法是生成自然语言优化思想再转化为代码,还使用多分支探索模式。
北大提出首个复数大模型,2比特量化,推理仅加法,可手机部署!
北大团队提出iFairy方案,将模型权重量化到复数集合,用2比特表示,压缩至原本1/8。推理仅需加减或交换数据位置,成本更低。Transformer架构“复数化”,iFairy模型PPL降10%,性能反超全精度,相关成果已开源。
AGI倒计时,OpenAI首席研究官重磅表态:留给人类的窗口「很小」
OpenAI首席研究官Mark Chen称AGI即将到来,模型能自主研究。他反对‘预训练已死’,认为Scaling曲线未到头。还提出‘Vibe Researcher’概念,不过通往AGI有评测和持续学习等问题待解决。
重磅!华为何庭波正式提出τ缩放定律,晶体管密度直指1.4纳米,麒麟2026首发验证
2026年,华为何庭波提出τ缩放定律,主张将时间常数τ作为半导体演进首要优化目标。该定律在手机端和AI数据中心验证有效,还涉及产业结构变化,但仍有工具链、工艺变异等问题待解。
重构线性视觉Transformer,精度与效率双平衡 | CVPR'25
南洋理工、北航与合工大联合提出CARE Transformer,以非对称解耦建模局部与全局,降低计算开销、提升特征表达。实验显示其在移动端低延迟高精度,打破“效率与精度不可兼得”困局。