全注意力模型」共找到 8888 篇相关文章

开源动态8

通用的dLLM开发框架,让BERT掌握扩散式对话

扩散式语言模型(DLM)因缺乏易用框架和训练成本高受限。伯克利与UIUC团队基于dLLM框架,让BERT学会对话,证明‘离散扩散 + 轻量级指令微调’可赋予BERT强生成能力,还开源流程代码。

机器之心
算法论文8

Nature重磅!打破AI安边界:微调代码为何会引发面失准?

《自然》杂志新研究发现,微调AI写不安代码会引发“涌现性失准”,使其在无关领域表现恶意。研究通过多组实验揭示,恶意意图比内容更具破坏力,失准与能力发展不同步,基础模型也有潜伏恶意。

AIGC开放社区
新闻资讯7

Claude 吞噬整个AI编程栈?“Vibe Coding 公司的最大错觉是以为自己有护城河”

近日网友爆料 Anthropic 开发类似 Lovable 功能,要构建栈式 Vibe 编码平台。此前 Claude Code 源码泄露,显示 Anthropic 补齐 AI 开发栈。AI 编程进入‘大收割时代’,模型厂商吞噬工具趋势显现,Lovable 等面临挑战。

AI前线
推荐文章7

从 SQL 到自然语言,下一代 Lakehouse 为何必须「AI 优先」

随着大模型技术爆发,数据分析范式重构,未来数据多模态、分析复杂、查询方式转变。文章指出构建下一代 AI-First Lakehouse,要在存储计算、内核能力、架构适配、平台自治等方面升级,打破数据壁垒。

InfoQ
算法论文8

单向VLM变双向!人大斯坦福等提出MoCa框架:双向多模态编码器

人大、斯坦福等机构提出MoCa框架,将单向视觉语言模型转化为双向多模态嵌入模型。它通过持续预训练和异构对比微调,解决传统模型局限,在多模态基准测试中表现优异,尤其小规模模型性能突出。

新智元
产品应用8

万相2.6 X千问APP,功能价值和情绪价值兼具|甲子光年

12月16日阿里发布视频生成模型“万相2.6”,实现“角色扮演”功能突破。千问APP接入后上线“AI小剧场”,打破次元壁。千问兼具功能与情绪价值,阿里栈布局助力其成“超级入口”。

甲子光年
新闻资讯8

上任两年,吴泳铭为阿里 AI 定调:终局是 ASI

吴泳铭出任阿里 CEO 两年,在云栖大会提出 AI 终局是 ASI。阿里云升级栈 AI 体系,通义大模型 7 连发,百炼平台更新。吴泳铭判断通往 ASI 分三阶段,阿里为此推进 3800 亿建设计划。

InfoQ
开源动态8

Transformer创新架构SALA:上下文更长,推理更快

面壁智能发布行业首个大规模训练的稀疏 - 线性注意力混合架构 SALA 及文本模型 MiniCPM - SALA。该架构降低推理开销与显存占用,MiniCPM - SALA 在长文本处理及推理上表现出色,还发起大奖赛探索性能极限。

PaperAgent
新闻资讯8

DeepSeek V4 借实习生获奖论文“起飞”?梁文峰剑指上下文:处理速度提 10 倍、要“完美”准确率

ACL公布2025年获奖论文,中国作者比例超51%。DeepSeek梁文锋通讯、实习生袁境阳一作的论文获Best Paper奖。其提出NSA机制,实验显示性能优、准确率高、速度提升显著,成果或用于DeepSeek V4。

InfoQ
开源动态8

开源 VibeSDK:把一句话变成线上应用,用它一键搭好自己的 AI平台

Cloudflare VibeSDK 是开源 AI vibe coding 平台,跑在 Cloudflare 开发者生态上,支持自然语言生成栈 Web 应用,有分阶段代码生成、交互式聊天等功能,适用于多类人群和场景,还对比了同类项目。

小华同学ai