语言模型微调」共找到 8027 篇相关文章

开源动态8

阿里 Qwen3:持续开源,SOTA 连连!

很多从业者有‘闭源模型一定比开源强’的刻板印象,而 Qwen 正打破此认知。最近阿里连发三款模型 Qwen3-235B、Qwen3-Coder、Qwen3-235B(Thinking),在多方向发力且拿下多个开源榜单第一。

特工宇宙
新闻资讯7

马斯克说漏嘴了!Claude Opus参数5T,Sonnet 1T

马斯克发帖透露xAI的Colossus 2超算训练模型情况,还回应网友时“手滑”泄露Claude的Sonnet 1T、Opus 5T参数。此外,文章梳理网友对Claude各版本参数的推测,也提到Anthropic未发布模型Claude Mythos。

量子位
新闻资讯7

拾象 AGI 观察:LLM 路线分化,AI 产品的非技术壁垒,Agent“保鲜窗口期”

这是「海外独角兽」的AI领域观察栏目访谈,拾象CEO李广密和财经作者张小珺梳理LLM领域信号。2025 Q2全球大模型爆发性强且分化,还提到AI Labs路线、产品壁垒、“保鲜窗口”及Agent体验等内容。

海外独角兽
新闻资讯7

重塑记忆架构:LLM正在安装「操作系统」

现代大型语言模型(LLM)存在「记忆缺陷」,难以维持长期记忆。近期关于大模型记忆的研究增多,如 MemOS 等。文中介绍了长上下文处理能力与记忆的关系、记忆类型,以及实现 LLM 记忆的多种方法和相关研究成果。

机器之心
新闻资讯8

三个关键词,2026谷歌 I/O大会全说透了

北京时间今天凌晨,谷歌 I/O 2026 落幕。皮查伊称聚焦模型、编程和智能体。模型上,Gemini 3.5 Flash 全量上线,性能超上一代;编程方面,Antigravity 2.0 用低成本造能跑 Doom 的系统;智能体层,Spark 和 Search Agents 让 AI 走出对话框。

腾讯技术工程
推荐文章8

WRC 2026 深度复盘:具身智能的「卡脖子」难题,终于有解了

本文复盘WRC 2026,指出具身智能面临数据焦虑,数采方与模型方割裂,数据采集成本高、效率低、质量差。自变量推出QUANXTA Zero系列无本体数采方案,从模型需求反向定义数采硬件,形成数据闭环,还具备底层技术支撑。

AI科技评论
产品应用8

刚刚,HiDream-O1-World首秀登顶,原生全模态UiT架构打造「可交互时代」

过去三年,AI 内容生成行业虽有技术迭代,但用户与模型交互仍单向。智象未来发布全球首款原生全模态交互式世界模型 HiDream - O1 - World,它基于 UiT 架构,在评测中表现出色,解决两大行业难题,应用前景广。

机器之心
新闻资讯7

OpenAI被曝瞄准AI音乐赛道商业化,Suno首当其冲

据悉,OpenAI已和艺术学院合作许久,不久将进军AI音乐。它正与茱莉亚学院学生合作标注乐谱用于模型训练,还可能探索To B市场。此前OpenAI就有音乐模型尝试,此次或因Suno盈利佳而重拾音乐梦,Suno恐受冲击。

量子位
算法论文7

苹果提出原生多模态Scaling Law!早融合+MoE,性能飙升秘密武器

如今打造强大多模态模型是AI重要目标,常用方法有局限。法国索邦大学、苹果研究人员开展原生多模态Scaling Laws研究,对比早融合与后融合,探讨多种因素对模型性能影响,发现早融合、多模态MoE优势,为后续研究指明方向。

新智元
开源动态8

AI安全上,开源仍胜闭源,Meta、UCB防御LLM提示词注入攻击

Meta和UCB开源安全大语言模型Meta - SecAlign - 70B,其对提示词注入攻击鲁棒性超闭源方案,还具更好的agentic ability。介绍了提示词注入攻击背景、防御方法,该模型打破闭源垄断,开源代码助力安全AI建设。

机器之心