无注意力模型」共找到 8091 篇相关文章

开源动态8

紫东太初开源视觉神经增强方法,即插即用终结多模态幻觉 | ACL 2025

中科院自动化所等团队提出VHR方案,通过“视觉神经增强”机制放大模型视觉关键注意力头输出,降低幻觉现象。此前主流方法多作用于最终输出阶段,VHR深入干预内部机制,还介绍了SSL语义引导方法。

量子位
推荐文章8

Astra 的 Computer Use 能力是如何实现的?

本文编译自Browserbase增长工程师Kyle Jeong的个人博客,对比了纯视觉路线Computer Use模型的缺陷,详细拆解Astra模型利用障碍树结合Codex Harness实现能力的架构、训练方法,分析其优劣与行业价值。

海外独角兽
新闻资讯8

“今天的顶级智能,一年后就会沦为平庸的廉价品” OpenAI总裁:AGI 的终极交互是“没有界面,没有产品”

OpenAI总裁Greg Brockman分享了对AI发展的看法,称2023年推出的插件功能失败,因当时大模型未准备好。他认为未来AGI是隐形虚拟助理,界面和产品。还指出算力稀缺,智能折旧快,模型改进空间大。

AI科技大本营
新闻资讯7

deepseek v4.1? 梁圣的端午礼物突袭。

群里小伙伴称deepseek官方灰度新模型,手机和web端Flash模型思考模式大变,典型bug修复。测试发现幻觉严重,知识库截止大概25年6月。同时,deepseek获500亿首轮融资,梁文锋自掏200亿,投资方投票权,五年锁定期。

探索AGI
开源动态8

机器人连续叠衣120分钟!仅用0.9B参数实现五大SOTA|清华AIR & 上海AI Lab开源

清华大学智能产业研究院与上海人工智能实验室联合发布通用跨本体具身基座模型X-VLA。它是首个实现120min辅助自主叠衣的全开源模型,仅0.9B参数量就在五大权威仿真基准刷新纪录。

量子位
产品应用7

我用给DeepSeek 加了个搜索功能

作者为弥补DeepSeek搜索聊天记录功能的不足,用Claude Code做了个插件。介绍了使用说明,还提及各LLM模型适用场景,称DeepSeek重模型智能,少营销但用户体验有折扣。此外,作者还用AI采集资讯发群。

AGI Hunt
推荐文章8

WRC 2026 深度复盘:具身智能的「卡脖子」难题,终于有解了

本文复盘WRC 2026,指出具身智能面临数据焦虑,数采方与模型方割裂,数据采集成本高、效率低、质量差。自变量推出QUANXTA Zero系列本体数采方案,从模型需求反向定义数采硬件,形成数据闭环,还具备底层技术支撑。

AI科技评论
算法论文8

模型大一统?1100多个模型殊途同归,指向一个「通用子空间」!

约翰斯・霍普金斯大学研究发现,1100多个不同神经网络,即便训练条件不同,最终权重会收敛到共享低维子空间。此研究为神经网络参数空间“通用性”提供严谨实证,虽成因待探索,但意义深远。

AINLPer
开源动态8

全景视觉的Depth Anything来了!Insta360推出DAP,200万数据打造全场景360°空间智能新高度

Insta360等团队推出全景度量深度基础模型DAP,构建200万量级全景数据引擎,设计三阶段伪标签管线,在模型架构上也有创新,在多项测试中效果优异,项目代码与模型已开源。

机器之心
算法论文8

Kimi新架构让马斯克叹服!17岁高中生作者一战成名

17岁高中生陈广宇作为共同一作的论文提出Attention Residuals技术,将注意力机制“旋转90度”。该技术可让模型“回头看”,经Kimi Linear 48B大模型验证,训练效率提升25%,推理延迟增加不到2%。

量子位