混合注意力架构」共找到 2125 篇相关文章

新闻资讯8

押注Agent,林俊旸带着新公司杀回来了

前阿里Qwen负责人林俊旸创办Pragmatik Labs/语用科技,研究跨数字与物理世界的下一代agent。红杉中国、高榕创投领投,腾讯等跟投。其目标是用agent实现终极生产力,有独特技术底色与愿景。

PaperAgent
算法论文8

具身智能空间视觉死穴,终于被最新顶会彻底解决!

招商局先进技术研究院下属实验室提出新的移动数据范式,以极低成本破解 VLA 的空间泛化瓶颈。研究团队识别出 VLA 模型三种捷径学习模式,提出层次化数据解耦策略,该方案在主流 VLA 模型上验证有效。

新智元
新闻资讯7

4·18 北京 Elastic AI Tech Day|搜索基座模型议程(含 Jina 模型与 Reader)

Jina AI 模型迭代加速,Jina Embeddings 到五代目,Reranker v3获最佳论文。4月18日 Elastic AI Tech Day 将举办,Jina 团队将做系统公开技术分享,涵盖搜索AI等多方面内容。

Jina AI
开源动态8

如何科学地“设计”SFT 数据?一次关于 ODA 的完整平台级验证

大模型后训练阶段,SFT数据构建常依赖‘直觉’或‘试错’。上海人工智能实验室OpenDataLab团队发布报告,基于OpenDataArena提出新范式,将数据集构建从‘随机艺术’变为‘确定性工程’,并进行平台级验证。

深度学习自然语言处理
Product Application8

ClawdBot传疯了!视频教程来了

外网疯传的ClawdBot由开发者Peter Steinberger开发,能通过多平台交互干活。介绍其技术架构、两种设置方式、成本,还有安全设置、测试方法、进阶功能、使用场景及硬件选择等。

AI工程化
开源动态7

R1一周年,DeepSeek Model 1悄然现身

2025年1月20日,DeepSeek发布DeepSeek - R1开启新开源LLM时代,其在Hugging Face获赞最多。一年后,DeepSeek新模型Model1在GitHub现身,经Gemini分析或为DeepSeek - V4,还给出相关技术细节。

机器之心
开源动态8

华为推出软工代码智能体SWE-Lego,解锁SFT训练极致性能

华为研究团队推出仅基于监督微调(SFT)的软件工程代码智能体SWE-Lego,无需复杂RL流程,在SWE-bench Verified基准中表现出色,项目已开源。它有数据、训练和测试时扩展三大创新。

机器之心
推荐文章7

前谷歌研究员发文:算力崇拜时代该结束了

前谷歌大脑研究员 Sara Hooker 发文指出,过去十年 AI 创新依赖算力,但如今持续扩展训练计算资源效率极低,收益递减。她探讨了影响算力回报率的因素,批判 Scaling Law,并提出未来创新方向。

机器之心
开源动态8

多人会话视频生成新突破:香港科技大学,浙江大学用单人数据实现多人交互视频生成

香港科技大学、浙江大学等开源 AnyTalker,提出音频驱动多人交互生成新范式。它用创新机制和两阶段训练策略,以少量数据实现多人视频生成,还构建评估指标,性能超现有方法。

AIGC开放社区
产品应用7

jiSGLang集成ktransformers:2TB内存运行Kimi K2 Thinking模型

对于内存多但GPU资源有限的用户,SGLang集成ktransformers的CPU内核,支持直接运行Kimi K2 Thinking模型。它无需等量化,还能微调,虽性能与GPU方案有差距,但给用户新选择。

AI工程化