「大模型架构」共找到 10017 篇相关文章

新闻资讯7

DeepSeek最会讨好,LLM太懂人情世故了,超人类50%

研究发现,LLM附和用户行为频率比人类高50%,GPT - 5讨好行为最少,DeepSeek - V3.1最多。此现象受《Nature》关注,在科研、日常及医疗等领域有隐患,还引发网友讨论。

机器之心
新闻资讯7

「我受够了Transformer」:其作者Llion Jones称AI领域已僵化,正错失下一个突破

颠覆性论文《Attention is all you need》作者之一Llion Jones在TED AI大会称厌倦Transformer。他认为AI领域资源多但创造力降,过度聚焦单一架构或错失重大突破,建议调高‘探索旋钮’并分享结果。

机器之心
算法论文8

ACMMM 2025 | 北大团队提出 InteractMove:3D场景中人与可移动物体交互动作生成新框架

北大团队在ACMMM 2025发布InteractMove,首次提出含可移动物体3D场景中基于文本的人 - 物交互生成任务,构建数据集与创新框架,在多指标领先,代码与模型已开源。

机器之心
新闻资讯8

29个月增长100倍:一个AI 2.0公司应该怎么建?HeyGen的取胜的秘密

AI视频生成公司HeyGen在29个月内ARR从100万美元增长到超1亿美元。创始人Joshua Xu公开取胜秘密,即独特运营模式‘The HeyGen Way’,包括拥抱变化、匹配节奏、最小化快速验证迭代等理念。

AI工程化
8

重磅!OpenAI官宣自研AI芯片:垂直整合要彻底摆脱英伟达,联手博通部署10吉瓦算力

OpenAI与博通达成深度战略合作伙伴关系,共同设计和制造AI芯片与计算系统,合作已秘密进行约18个月,目标是2026年底部署10吉瓦算力,还在用模型探索芯片设计新方法。

AI寒武纪
算法论文8

ICLR神秘论文曝光!SAM3用「概念」看世界,重构视觉AI新范式

2023年Meta推出SAM,后SAM 2扩展到视频分割。近日,SAM 3现身ICLR 2026盲审论文,带来「基于概念的分割」新范式,强调按「语义概念」理解和分割图像,还构建数据引擎提升性能。

新智元
新闻资讯8

Google封神,计算机视觉的GPT3时刻来了!

Google Deepmind称在CV领域做出类似GPT-3的成果,Veo 3经大规模训练涌现通用视觉理解和推理能力,能以图片+提示词完成复杂视觉任务,还具备感知、建模等四大超能力。

探索AGI
新闻资讯7

重生之在《我的世界》做山姆·奥特曼:网友在线手搓ChatGPT

一老哥在《我的世界》上手搓出有500万个参数的ChatGPT,经英语对话训练,能在像素世界小电脑上对话,用红石电路和存储单元搭建,未用指令集,网友还在游戏里开发出诸多东西。

量子位
产品应用8

云栖大会演讲实录:Qoder 产品背后的思考与未来发展

这是云栖大会上关于 Qoder 产品的演讲实录。Qoder 是阿里推出的 Agentic 编程平台,上线一月收获数十万用户。介绍了 AI Coding 三阶段,阐述 Qoder 定位、功能模式、技术优势,展望 AI Coding 未来。

阿里云开发者
算法论文8

Thinking Machines新发现:Lora不是权宜之计,哪怕秩低到 1,也能匹敌全参数微调

Thinking Machines和John Schulman新研究刷新对LoRA的认知,实验显示正确使用时它能匹敌全量微调。团队系统研究训练集与参数关系,有层选择、学习率等关键发现,还给出实用建议,但LoRA在部分场景表现待验证。

AI工程化