微调加速」共找到 886 篇相关文章

新闻资讯7

号称1200万token上下文的模型来了,数据亮眼但疑点重重

当地时间5月5日,Subquadratic公司推出模型SubQ,称是LLM智能重大突破,有1200万token上下文。数据亮眼,如在1M token场景比FlashAttention快52倍等,但也引发质疑,有人推测是对开源模型微调,官方未公布详细模型卡。

DeepTech深科技
新闻资讯8

“商业的HTTP”来了:谷歌CEO劈柴官宣 UCP,Agent 直接“剁手”下单,将倒逼淘宝京东“拆家式重构”?

近日谷歌CEO官宣Universal Commerce Protocol(UCP),目标让Agent在线购物。它能拆解购物流程,与多协议协同。谷歌补数据底座,UCP集结众多伙伴,Agent加速落地交易场景,或使电商平台重构。

AI前线
新闻资讯7

聊一聊数据中心的投资现状

文章结合多份报告和访谈,分析国外大厂对IDC的态度。微软投资放缓,因资源消化、建设复杂等;OpenAI加速基础设施投入;其他巨头虽强调财务纪律,但核心AI投入未放缓,行业仍处增长早期。

芯师爷
新闻资讯8

英伟达改卖Token?黄仁勋GTC后发声:token就是AI新通货,值钱的不是算力,是“每度电的智商”

英伟达黄仁勋在采访中强调其是加速计算公司,非单纯 GPU 公司。他认为 AI 竞赛从拼算力变拼产出,token 是新通货,还阐述了 AI 瓶颈、架构发展、推理编程、CPU 角色等观点。

AI前线
开源动态8

The Batch: 849 | 用于训练网页智能体的生成数据

开发网页智能体常需大量人力标注训练样本,卡内基梅隆大学与亚马逊团队实现训练数据生成自动化。他们构建数据集,通过智能体工作流程生成数据,微调后 Qwen3 - 1.7B 表现出色,还公开数据与方法。

DeeplearningAI
新闻资讯7

Anthropic 发布第四份人类经济指数报告:AI 对全球工作的影响仍然不均衡

Anthropic发布第四份经济指数报告,提出“经济基元”概念,用五个基础指标衡量AI使用情况。报告发现任务越复杂,AI加速效果越明显,不同国家使用方式有差异,还提及“去技能化”等情况及对生产力的影响。

AGI Hunt
算法论文8

奖励模型预训练新范式POLAR:突破强化学习短板,有望打通RL链路扩展“最后一环”

强化学习中奖励模型设计与训练是瓶颈,上海人工智能实验室提出奖励建模新范式POLAR。它摆脱传统“绝对偏好”限制,契合强化微调框架,通过对比学习训练,实验证明其性能和泛化性佳,有望打通RL链路扩展最后一环。

OpenMMLab
新闻资讯7

Mistral AI发布一站式编程助手Mistral Code

法国开源大模型平台Mistral AI发布一站式编程助手Mistral Code,旨在解决企业开发人员使用AI编码工具时的合规与安全障碍。它基于Continue开发,集成四个大模型,还能在私有代码库微调,获早期客户认可。

AIGC开放社区
新闻资讯8

奥特曼:温和奇点已降临!AI最终掌控物理世界,2030年人类命运大转折

奥特曼在「温和的奇点」一文中称人类跨越AI发展「事件视界」,进入指数级加速阶段。他预测了未来5年技术时间线,还指出奇点悄然渗透,AI自转飞轮越来越快,人类迈向超级智能时代机遇与挑战并存。

新智元
产品应用8

腾讯AngelSlim重磅升级!面向全模态的大模型压缩算法工具包,推理速度飙升 1.8倍!

近年来,推理阶段的成本等因素制约大模型规模化应用。腾讯混元升级的 AngelSlim 围绕 Eagle3 投机采样训练范式构建系统化实现,支持多模态场景,最高可实现 1.9× 推理加速,还具备多亮点。

腾讯技术工程