可灵 2.1」共找到 6533 篇相关文章

开源动态8

语音界Sora!微软刚开源新模型,一次生成90分钟语音、3200倍压缩率

今天凌晨微软研究院开源创新音频模型VibeVoice - 1.5B,有诸多技术突破,如合成90分钟语音、支持4名发言人、3200倍音频压缩等,还首创双tokenizer协同架构。未来微软还会开源更大参数模型。

AIGC开放社区
算法论文8

清华刘知远团队论文:最小化结构改动,短文本到长文本丝滑升级 | ICLR 2026

大语言模型发展中,上下文长度成关键瓶颈,主流架构计算开销大。清华刘知远团队提出《InfLLM-V2: Dense-Sparse Switchable Attention for Seamless Short-to-Long Adaptation》,提出切换注意力框架,为长上下文研究提供新思路。

AI科技评论
算法论文7

LLM的RL训练轨迹竟然是线性的?Miaow Lab|新工作:无需继续训练,直接“预测”未来模型!

文章介绍《Not All Steps are Informative: On the Linearity of LLMs' RLVR Training》,揭示RLVR训练中LLM权重和输出概率线性变化,提出“权重外推”法,实现6.1倍训练加速,还介绍三种策略及实验结果。

AINLPer
开源动态7

谷歌 Java 代理开发工具包新增 LangChain4j 集成

谷歌 Java 代理开发工具包(ADK)0.2.0 版本集成了 LangChain4j,显著扩展功能,让开发者能使用更多模型。谷歌开发者 Guillaume Laforge 解释其优势,ADK 还引入系列增强提升性能。

InfoQ
新闻资讯7

DeepSeek最会讨好,LLM太懂人情世故了,超人类50%

研究发现,LLM附和用户行为频率比人类高50%,GPT - 5讨好行为最少,DeepSeek - V3.1最多。此现象受《Nature》关注,在科研、日常及医疗等领域有隐患,还引发网友讨论。

机器之心
产品应用7

The Batch:834 | 更一致的人物与风格

德国 Black Forest Labs 的 FLUX.1 Kontext 系列文本生成图像模型,控编辑图像。有 max、pro 和 dev 版本,功能含角色一致性和图像编辑,在测试中表现优,公司计划公开专有评估基准。

DeeplearningAI
7

全球价值最高创企诞生,OpenAI估值创纪录来到5000亿美元

几天前OpenAI发布视频大模型Sora 2,获Altman盛赞。据彭博社,OpenAI完成交易,员工按5000亿美元估值售股。年初其估值3000亿美元,此次提升突显其用户与收入快速增长。

机器之心
产品应用8

模型测试不再跳来跳去,VS Code + Hugging Face = 真香

Hugging Face 发布新功能,让开发者在 VS Code 的 GitHub Copilot Chat 中直接接入 Inference Providers,调用 Kimi K2 等开源大模型测试,无需频繁切换平台。该功能有统一 API 等优势,定价门槛低。

InfoQ
产品应用7

WAIC最强亮点:非Transformer离线AI大模型已大规模量产,大模型商业比我们想得更快

在WAIC上,RockAI推出非Transformer离线AI大模型Yan 2.0 Preview,有视觉感知跃升和自主学习能力两大提升。该公司走非Transformer路线,着重场景落地,通过“标杆战略”推动产品量产,未来构想构建“群体智能”世界。

AI科技评论
产品应用7

用AI把一段视频变成视化网页,Google的新模型又卷飞了。

Google将Gemini 2.5 Pro更新为05 - 06版,此版代码能力在WebDev Arena盲测竞技场登顶,还提升视频理解能力,将视频变成视化网页,虽产品有不足,但模型进步值得肯定。

开源星探