「预发部署」共找到 1442 篇相关文章
Attention真的可靠吗?上海大学联合南开大学揭示多模态模型中一个被忽视的重要偏置问题
上海大学曾丹团队联合南开揭示Vision - Language Models中普遍的attention偏置问题,提出无需重训的去偏方法,在多模型、策略及基准上验证有效性,为多模态模型部署提供新思路。
Karpathy最新手搓!复现GPT-2成本狂降600倍:仅需507元3小时训练「最好的AI学习项目」
Andrej Karpathy的个人项目nanochat更新,现训练GPT - 2级别的LLM成本低于100美元,在单个8XH100节点上仅3小时花约73美元,较7年前成本降600倍,还列出关键优化技术,设排行榜。
从顶级三甲到医疗巨头,他们为何都选择同一个AI“大脑”?
AI医疗迎来爆发,政策、技术、需求共振催生千亿蓝海。智诊科技WiseDiag医学多模态大模型成医疗企业破局关键,它有三大核心能力,适配多场景,还有低风险接入方案,现开放API免费试用。
ICLR 2026 放榜了!28%接收率,欢迎投稿机器之心
ICLR 2026 官方深夜发论文接收结果,会议 2026 年 4 月在巴西举行,收稿约 19000 篇,录取率约 28%。网友晒成绩,不过本届堪称“史上最乱”,有审稿问题,还被质疑用 AI 生成意见。
高效智能体的「幕后推手」是谁?一篇综述带你从记忆×工具学习×规划看透
随着大模型能力提升,业界关注智能体落地,而高效性是决定能否上线的‘硬’问题。论文梳理‘高效智能体’综述,从记忆、工具学习、规划三机制出发,还谈及基准评测、挑战与展望。
Cloudflare 通过左移安全实践扩展基础设施即代码
Cloudflare实施基础设施即代码和自动化策略执行,将安全验证前置,消除手动配置错误,在部署前捕捉安全违规。该方案以Terraform等为核心,还解决了采用难题、配置漂移等问题。
多模态Qwen3-VL-Embedding开源&技术剖析
互联网内容多元,传统文本搜索引擎应对跨模态需求力不从心。阿里开源Qwen3-VL系列两大模型,Qwen3-VL-Embedding负责“海选”,Qwen3-VL-Reranker负责“决赛”,技术亮点多,实验表现优异。
刚刚,梁文锋署名开源「记忆」模块,DeepSeek V4更细节了
十几个小时前,DeepSeek 发布新论文,与北大合作,作者有梁文锋。针对大模型问题提出条件记忆,用 Engram 模块实现,已开源。结合此前研究,DeepSeek v4 模样渐清。模型性能、效率表现优,并发现 U 型扩展规律。
“机器人一次性卖完太亏!”真机智能刘智勇:今年中国本体厂商将大淘汰,拼的是世界模型?
InfoQ采访真机智能刘智勇,探讨具身智能领域进展、技术瓶颈及商业方向。刘智勇指出,VLN技术有进展但导航成功率待提升,世界模型可提升机器人能力,2026年本体厂商将收缩,盈利是核心。
告别碎片化日志:一套方案采集所有主流 AI 编程工具
在AI编程工具普及的当下,有效采集和分析AI代码生成数据成重要课题。该文介绍一套基于MCP架构的多AI工具代码采集方案,支持多种工具和操作系统,有轻量化、用户无感等特点,已和Aone合作。