「量化感知训练」共找到 2560 篇相关文章
何恺明首个语言模型:105M参数,不走GPT自回归老路
何恺明团队推出全新连续扩散语言模型ELF,不走GPT自回归老路。它将生成过程留在连续embedding空间,最后离散化变回token。ELF用较少参数、训练token和采样步数,跑赢主流扩散语言模型。
CVPR 2026 Oral|横扫室内3D场景,港科大(广州)打造单目开放词汇占据预测新SOTA
具身感知核心难题待解,传统占据预测方法有局限。港科大(广州)陈昶昊教授团队提出 LegoOcc,首次实现单目开放词汇三维占据预测,在多方面展现优势,未来或让家用机器人精准定位目标。
ACL 2026|答得更准还写得更短?华为泰勒实验室提出SHAPE,给LLM推理装了个「推理税」
华为泰勒实验室等团队提出 SHAPE,给推理链装「里程碑 + 推理税」机制。它分三步,能统一势能增益度量、阶段难度感知和 token 效率约束。实验显示,它提升准确率、降低 token 消耗,还解决了推理坍缩等问题。
20亿美金苏度科技具身首秀即大招!0真机数据,zero-shot,跑出98%首次抓取成功率
苏度科技发布软硬件全栈自研的机器人系统R1,采用世界模型与强化学习一体化设计,在不使用真机数据的前提下,实现关键任务近100%的Zero-shot成功率。苏度团队通过重新定义数据范式,解决了具身智能发展的核心瓶颈。
ThinkingAI硅谷首秀,发布企业级Agent平台Agentic Engine|甲子光年
美国当地时间4月16日,ThinkingAI在硅谷举办发布会,宣布更名并发布企业级Agent平台Agentic Engine,还与Minimax达成合作。该平台有行动闭环、全域感知、私有化部署三项核心能力,能让系统替企业完成业务全流程。
Claude Opus 4.7发布!这是你在别的公众号看不到的五个发现
Anthropic发布Claude Opus 4.7,编码和视觉能力提升,但长上下文能力下降。其231页的System Card藏着不少有趣发现,如Opus 4.7非最强模型、Claude知道被测试、模型审查自身评估等。
刚刚,Anthropic首超OpenAI!暴买谷歌TPU,Claude杀疯了
Anthropic与谷歌、博通合作打造3.5 GW TPU集群,预计2027年上线。其年化收入破300亿美元首超OpenAI,客户呈指数级增长。但训练和推理成本高,与OpenAI都在冲刺IPO,竞争激烈。
堆推理链全错了!林俊旸离职首曝:曾在阿里 Qwen 踩中一个“致命”技术误区
阿里千问技术负责人林俊旸离职后发声,复盘 Qwen 训练尝试,指出合并 thinking 和 Instruct 模式不理想。他认为大模型未来应从‘推理思维’走向‘智能体思维’,并阐述了智能体思维的特点和挑战。
谷歌的DeepSeek时刻:LLM推理加速被干到了8倍
谷歌TurboQuant论文介绍量化算法,能为大语言模型和向量搜索引擎大规模压缩。可将大语言模型KV缓存内存减至少6倍、加速达8倍且精度零损失,还介绍其工作原理及实验结果。
Rokid火得太晚了
消费电子市场中AI眼镜迎曙光,乐奇Rokid成AI+AR品类全球销冠。它通过双目衍射光波导和双芯片架构解决轻量化与续航难题,还以开放生态脱颖而出,其判断未来眼镜将成交互主体。