全4比特量化」共找到 1989 篇相关文章

算法论文8

大模型人格可以被量化!Anthropic最新论文发现“辅助轴”,开辟人类控制AI新道路

Anthropic等机构研究团队深入模型激活空间,发现大模型人格可量化,存在“辅助轴”。沿此轴干预能预测、解释“人格漂移”,用“激活上限”技术稳定模型行为,抵御越狱攻击,开辟人类控制AI新道路。

AI寒武纪
新闻资讯7

文件被 Gemini 当场“格式化”,没了!网友控诉:Claude、Copilot 也爱删库,一个都跑不了

开发者 anuraag2601 用 Gemini CLI 做文件管理测试时,Gemini 操作失败致文件丢,事后不断道歉。网友也反映 Claude、Copilot 等有类似删库问题,这或是模型训练导向问题。

InfoQ
开源动态8

英伟达新架构引爆模态大模型革命,9B模型开源下载即破万

英伟达推出模态大模型OmniVinci并开源,其90亿参数规模性能超同级别甚至更高级别模型,训练数据效率是对手6倍,能精准解析视频和音频,在多模态应用场景中表现卓越,下载量破万。

新智元
开源动态8

让GPU不再摸鱼!清华蚂蚁联合开源首个异步RL,一夜击穿14B SOTA

清华与蚂蚁联合开源AReaL - boba²,实现异步强化学习训练系统,解耦模型生成与训练流程,大幅提升GPU利用率。14B模型在多个代码基准测试达SOTA,性能接近235B模型。

新智元
产品应用8

上海AI实验室发布『书生』具身栈引擎,推动机器人大脑进入量产时代 | WAIC 2025

上海AI实验室发布『书生』具身栈引擎Intern - Robotics并开放,它有一脑多形、虚实贯通、训测一体等创新。还启动‘具身智能光合计划’,15家企业机构已加入,助力解决行业难题,推动具身大脑量产。

OpenMMLab
算法论文8

RL训练一层就够了!单层RL超越参数训练,跨任务跨模型跨算法部验证

明尼苏达大学、北大和亚马逊团队研究发现,RL收益集中在中间层,训练单层可超参数训练。他们提出层贡献度指标,经多模型、算法、任务实验验证,还给出三种训练优化策略。

机器之心
开源动态8

谷歌Gemma 4系开源:3.8亿激活超越20倍体量模型,手机秒变AI工作站

谷歌发布Gemma 4系列开源模型,有4个尺寸。它在硬件适配、注意力机制等方面革新,能在手机等设备运行,在测试中成绩出色,还获多平台支持,谷歌发起挑战赛鼓励开发者。

AIGC开放社区
开源动态8

Karpathy再放大招:8000行代码复现ChatGPT栈,最低成本仅100美元,4小时跑完

Andrej Karpathy发布项目nanochat,是栈式ChatGPT克隆体训练/推理流水线,代码约8000行,覆盖训练分词器、预训练等完整流程。介绍不同成本下模型表现,还回答网友关于架构、训练数据等问题。

AI寒武纪
新闻资讯7

00后中国女孩0产品创业实现3亿估值:斯坦福数学博士的AI量化野心

00后中国女孩洪乐潼创业一鸣惊人,虽无产品和用户,但目标估值3 - 5亿美元。她是斯坦福华人数学博士,公司Axiom想为量化和对冲基金公司提供解决数学问题的模型能力,获投资人关注。

量子位
算法论文8

华为中科大联创大模型低比特量化算法,1‰数据实现昇腾无损压缩7倍

华为诺亚方舟实验室联合中科大提出CBQ后训练量化方案,仅用0.1%训练数据实现大模型7倍压缩,保留99%精度。该成果登ICLR 2025 Spotlight,已加入昇腾ModelSlim工具包。

新智元