新能安」共找到 7785 篇相关文章

算法论文8

VLA模型为何忽视语言?破解指令跟随幻觉,分布外场景泛化突破

当前VLA模型常依赖视觉线索而非语言指令,导致场景表现不佳。论文提出LangForce方法,引入对数似然比损失,强化模型对语言的依赖,提升分布外泛化力,还保留语言核心功

新智元
算法论文8

CVPR 2025 Highlight | 提升自回归模型样例学习力,Few-shot图像编辑范式开源

当前图像编辑模型在处理概念时泛化力不足,为解决此难题,Meta等研究者提出自回归模型InstaManip,创性提出分组自注意力机制和关系正则化策略,在few - shot图像编辑任务上取得优异效果。

机器之心
推荐文章8

Vibe Coding 方法论:不会编程的人如何用 AI 写出跑的代码

文章介绍 Vibe Coding 方法论,即便不会编程,也用 AI 写出跑的代码。核心是把需求说清楚,还可小步迭代开发,Claude 这类会主动询问的工具更适用,同时要明确其适用场景。

宝玉AI
开源动态8

文本已死,视觉当立!Karpathy狂赞DeepSeek模型,终结分词器时代

DeepSeek成果DeepSeek - OCR以像素处理文本,压缩率小于1/10,基准测试领跑,开源一夜获4.4k星。Karpathy力挺,认为应赶走分词器,展望视觉成通用输入前景,马斯克有更科幻猜想。

新智元
开源动态8

腾讯开源智框架:不用训练无需充值,用开源模型实现SOTA Agent

体框架是推动智体生态发展的基础设施,但现有框架存在上手门槛高、依赖闭源模型等问题。腾讯优图实验室开源Youtu - agent框架,无需训练模型、不依赖闭源API,性领先,有多个核心亮点和典型应用案例。

量子位
算法论文8

迈向原生全模态AI智体:人大&小红书发布OmniGAIA基准

中国人民大学等团队推出 OmniGAIA 基准及 OmniAtlas 训练框架。OmniGAIA 含 360 个高难度任务,覆盖多领域。实验显示闭源与开源模型差距大,OmniAtlas 显著提升开源模型表现,并指出未来全模态智体发展方向。

PaperAgent
算法论文8

OpenClaw代码越改越崩?研究EvoClaw揭示:Agents持续开发成功率仅13.37%

USC邓港大等联合发布评估基准EvoClaw,揭示AI在持续开发场景下表现不佳,成功率仅13.37%。研究还指出当前评测易高估AI力,提出DeepCommit重构演进历史,分析各模型在持续演进中的局限与问题。

量子位
产品应用7

AI 创作继续:Google 推出Pomelli,一款读懂你网站气质的 AI 营销设计师

Google Labs推出AI营销工具Pomelli,可帮中小企业几分钟内创建符合品牌的社交媒体活动。流程为给其网站,它建立品牌“商业DNA”,生成活动创意和资产,用户编辑调整即可。输出仅支持英文,出海网站可尝试。

AI进修生
新闻资讯7

@所有人:ChatGPT已正式加入群聊!

昨天,OpenAI让ChatGPT进群,它被@、插话、总结,还看聊天记录。群聊让它从‘私人助理’变‘群体成员’,面临多重语境挑战,也成了AI学习社交分寸、迈向‘社会智’的试炼场。

新智元
推荐文章7

中学生就看懂:从零开始理解LLM内部原理【十三】|GPT 架构如何工作 ?

本文是对GPT架构工作原理的解读。介绍了GPT与Transformer的关系,阐述其从输入文本到预测下一词概率的流水线,详述训练和推理流程,还提及GPT架构进化的混合专家(MoE)模型。

AI大模型应用实践