「新能安」共找到 7785 篇相关文章
VLA模型为何忽视语言?破解指令跟随幻觉,分布外场景泛化新突破
当前VLA模型常依赖视觉线索而非语言指令,导致新场景表现不佳。论文提出LangForce方法,引入对数似然比损失,强化模型对语言的依赖,提升分布外泛化能力,还保留语言核心功能。
CVPR 2025 Highlight | 提升自回归模型样例学习能力,Few-shot图像编辑新范式开源
当前图像编辑模型在处理新概念时泛化能力不足,为解决此难题,Meta等研究者提出自回归模型InstaManip,创新性提出分组自注意力机制和关系正则化策略,在few - shot图像编辑任务上取得优异效果。
Vibe Coding 方法论:不会编程的人如何用 AI 写出能跑的代码
文章介绍 Vibe Coding 方法论,即便不会编程,也能用 AI 写出能跑的代码。核心是把需求说清楚,还可小步迭代开发,Claude 这类会主动询问的工具更适用,同时要明确其适用场景。
文本已死,视觉当立!Karpathy狂赞DeepSeek新模型,终结分词器时代
DeepSeek新成果DeepSeek - OCR以像素处理文本,压缩率小于1/10,基准测试领跑,开源一夜获4.4k星。Karpathy力挺,认为应赶走分词器,展望视觉成通用输入前景,马斯克有更科幻猜想。
腾讯开源智能体新框架:不用训练无需充值,用开源模型实现SOTA Agent
智能体框架是推动智能体生态发展的基础设施,但现有框架存在上手门槛高、依赖闭源模型等问题。腾讯优图实验室开源Youtu - agent框架,无需训练模型、不依赖闭源API,性能领先,有多个核心亮点和典型应用案例。
迈向原生全模态AI智能体:人大&小红书发布OmniGAIA新基准
中国人民大学等团队推出 OmniGAIA 新基准及 OmniAtlas 训练框架。OmniGAIA 含 360 个高难度任务,覆盖多领域。实验显示闭源与开源模型差距大,OmniAtlas 显著提升开源模型表现,并指出未来全模态智能体发展方向。
OpenClaw代码越改越崩?新研究EvoClaw揭示:Agents持续开发成功率仅13.37%
USC邓港大等联合发布评估基准EvoClaw,揭示AI在持续开发场景下表现不佳,成功率仅13.37%。研究还指出当前评测易高估AI能力,提出DeepCommit重构演进历史,分析各模型在持续演进中的局限与问题。
AI 创作继续:Google 推出Pomelli,一款能读懂你网站气质的 AI 营销设计师
Google Labs推出AI营销工具Pomelli,可帮中小企业几分钟内创建符合品牌的社交媒体活动。流程为给其网站,它建立品牌“商业DNA”,生成活动创意和资产,用户编辑调整即可。输出仅支持英文,出海网站可尝试。
@所有人:ChatGPT已正式加入群聊!
昨天,OpenAI让ChatGPT进群,它能被@、插话、总结,还能看聊天记录。群聊让它从‘私人助理’变‘群体成员’,面临多重语境挑战,也成了AI学习社交分寸、迈向‘社会智能’的试炼场。
中学生就能看懂:从零开始理解LLM内部原理【十三】|GPT 架构如何工作 ?
本文是对GPT架构工作原理的解读。介绍了GPT与Transformer的关系,阐述其从输入文本到预测下一词概率的流水线,详述训练和推理流程,还提及GPT架构进化的混合专家(MoE)模型。