后Transformer时代」共找到 3169 篇相关文章

新闻资讯7

Ilya最新证词:谋划一年、52页黑材料、阅即焚邮件,以及与宿敌Anthropic的合并

Ilya在马斯克起诉Sam Altman案中的62页证词曝光,围绕罢免Altman事件展开。涉及Ilya写的52页秘密备忘录、对Altman的指控、董事会决策情况,还有与Anthropic的合并谈判及Ilya财务利益审查。

AI寒武纪
开源动态8

代码生成要变天了?被质疑架空,Yann LeCun携320亿参数开源世界模型“杀回来了”

在新一代代码生成模型不断涌现的当下,Meta FAIR CodeGen团队由Yann LeCun领导发布了代码世界模型CWM。它有320亿参数,创新训练方式使它不仅会写代码,还能模拟执行,性能测试表现不俗,在圈内引发热议。

AI前线
开源动态8

代码生成要变天了?被质疑架空,Yann LeCun携320亿参数开源世界模型“杀回来了”

美国当地时间9月24日,Yann LeCun团队发布320亿参数代码世界模型CWM。它创新训练方式,能模拟代码执行。性能测试表现出色,还开放检查点。Meta AI业务重组,CWM发布或表明未彻底放弃开源。

InfoQ
新闻资讯8

写代码写出26亿身家、“淘宝第一个程序员”多隆离职重出江湖,加入老同事创企,“杀入”AI赛道!

技术大牛多隆离开效力25年的阿里,于8月6日加入贝联珠贯,投身AI赛道。他曾是“淘宝第一个程序员”,一路走到阿里P11、成为合伙人,身家达26亿。此次他将和老同事毕玄用AI Agent改写运维服务格局。

AI科技大本营
开源动态8

告别Transformer!北大、北邮、华为开源纯卷积DiC:3x3卷积实现SOTA性能,比DiT快5倍!

北大、北邮和华为研究提出纯卷积扩散模型 DiC,抛弃自注意力机制回归 3x3 卷积。它性能超 DiT,推理速度快 5 倍,证明精心设计的卷积网络在生成任务中也能表现卓越。

机器之心
开源动态8

项目在GitHub上已获得约3600+star,探秘 ChatDoctor:LLaMA 微调的 AI 医生,真能在线问诊?

现代医疗资源不均、问诊效率低,ChatDoctor应运而生。它基于LLaMA微调,有医学对话微调等亮点,技术优势多,适用于在线问诊等场景,与同类对比优势明显,开源助力医疗对话模型发展。

小华同学ai
开源动态7

Claude时代终结?LMArena实测DeepSeek R1编程得分超Opus 4,但月暗称其新模型更胜一筹

在闭源模型主导的AI环境下,开源的DeepSeek - R1(0528)在LMArena测试中表现亮眼,编程得分超Claude Opus 4,引发社区关注与讨论。不过LMArena曾被指责偏袒,其联合创始人反驳。此外,月之暗面新模型Kimi - Dev - 72B编程成绩超R1。

AI前线
产品应用8

豆包 1.6发布,我用火山引擎Trae + MCP,仅半天做了一个“秒懂科研”的PaperAgent!

文章介绍用火山引擎Trae + MCP和豆包1.6构建“秒懂科研”的PaperAgent。对比其与传统开发范式,突出前者高效、低成本优势,还展示了PaperAgent技术栈及开发过程,体现AI云原生开发魅力。

PaperAgent
新闻资讯7

独家|浙大00世界模型创业,完成新一轮亿元融资,已在多个产业领域实现交付

2021年浙大陈天润成立魔芯科技,早期围绕AI驱动3D内容生成。2024年底转向3D场景建模和世界模型,走纯隐式方法。团队年轻有优势,已产生收入,完成融资,将推新模型,目标是实现‘3D的ChatGPT时刻’。

DeepTech深科技
产品应用8

阿里Qwen3.5小模型发布:0.8B参数就能处理视频,边缘AI时代真的来了

阿里通义千问发布Qwen3.5系列四款小模型,采用Gated DeltaNet混合注意力机制。有原生多模态设计,解决“内存墙”问题。在多基准测试中表现出色,开发者反响好,但也存在幻觉级联、调试局限等问题。

AI工程化