大模型V4」共找到 9312 篇相关文章

算法论文8

最具争议性研究:模型中间层输出可 100% 反推原始输入

利罗马第一学GLADIA Research Lab论文提出主流Transformer语言模型信息处理几乎不丢内容,是可逆的。实验验证其单射性,SIPIT算法能100%重建输入。研究有新视角,但也引发讨论。

AI科技评论
产品应用7

Cursor自研模型反超Opus 4.6!价格脚踝斩,氛围编程沸腾了

Cursor新编程模型Composer 2性能超Claude Opus 4.6,价格“脚踝斩”。它靠引入新强化学习方法,让模型学会“做笔记”突破上下文瓶颈,在任务中表现出色,研究员还放出Composer 3消息。

量子位
开源动态8

哔哩哔哩献给二次元世界的礼物—AniSora,目前最强的开源动漫视频生成模型

动画视频生成评估挑战,现有模型处理动画视频力不从心。哔哩哔哩推出AniSora综合系统,支持一键生成多种动漫风格视频镜头,在角色和动作表现上出色,在多维度超越当前先进模型

带你学AI
算法论文8

VDC+VBench双榜第一!强化学习打磨的国产视频模型,超越Sora、Pika

复旦学等机构将强化学习引入视频生成领域。提出的Cockatiel方法在VDC榜单夺冠,IPO方法在VBench登顶,超越Sora、Pika等模型,优化后视频生成效果在多方面显著提升。

机器之心
开源动态8

Agentic Coding表现创新高,全新KAT系列模型强势霸榜SWE-Bench

快手 Kwaipilot 团队推出 KAT 系列两款 Agentic Coding 模型,KAT - Dev - 32B 开源,KAT - Coder 闭源。两模型在 SWE - Bench Verified 表现出色,且在多训练阶段创新优化,有强代码生成能力和涌现现象。

机器之心
开源动态7

DeepSeek 新模型 R1-0528 悄悄开源,与o3 相当,实测来了。

DeepSeek团队悄无声息地在Hugging Face上开源推理模型新升级版DeepSeek R1-0528,基于DeepSeek-V3-0324模型,架构和训练方法有改进,性能与o3相当,实测表现不错。

AI进修生
新闻资讯8

智谱定档模型第一股,1月8日挂牌上市,IPO预募资43亿港元

智谱定档2026年1月8日在港交所主板挂牌上市,预募资43亿港元,上市后市值预计超511亿港元。它是中国最早开展LLM研发的公司,多模型表现亮眼,靠MaaS模式实现盈利,但研发投入巨

量子位
开源动态7

MIT和加州联手打造多智能体语言模型的金融交易框架TradingAgents

MIT和加州联手打造多智能体语言模型的金融交易框架TradingAgents,将交易任务分解为专业角色,含分析师、研究员等。介绍了安装、CLI使用、包的实现细节等,还提及项目地址。

GitHubStore
新闻资讯7

个人开发者训400亿参数模型:分布式算力,DeepSeek架构,3090单卡部署

Nous Research推出Psyche Network,可整合全球算力训练AI。它基于Deepseek的V3 MLA架构,有DisTrO优化器等技术,能让个人和小团体创建规模模型,还实现40B参数LLM预训练。

量子位
开源动态8

NVIDIA重磅开源!OmniVinci 仅 9B 模型就拿下多模态冠军!

英伟达推出全模态语言模型 OmniVinci,架构有三创新。OmniVinci - 9B 模型表现亮眼,多测试中幅超 Qwen2.5 - Omni,且训练量仅为其六分之一。其架构经多阶段流程实现全模态理解,还支持多种功能。

带你学AI