长文本训练」共找到 2928 篇相关文章

产品应用7

Marble登场!告别不稳定与变形,持久探索3D世界

李飞飞团队World Labs推出Marble并开放有限测试预览,基于图像或文本提示可生成3D世界,具有持久、稳定、风格多样等特点。用户能导出使用,在浏览器自由导航,虽有局限但潜力大。

带你学AI
算法论文8

开放世界任务成功率82%!美的攻克机器人泛化控制难题

美的AI研究院和华东师范大学联合提出ChatVLA - 2模型,引入动态混合专家架构和双阶段训练流程。真机实验显示其开放世界任务成功率达82%,远超现有方法,为通用机器人控制提供新思路。

量子位
新闻资讯7

想进OpenAI?先解出这道题,百万美元算力已就位

OpenAI发起Model Craft Challenge「Parameter Golf」项目,要求在固定数据集上降验证损失,模型产物控制在16MB内,8张H100 GPU 10分钟完成训练。提供百万美元算力,6月招早期人才,挑战3月18日至4月30日。

机器之心
开源动态8

3A大作!阿里ROLL团队从基建->算法->机理,推动RL4LLM全栈协同优化

阿里巴巴ROLL团队联合高校推出「3A」协同优化框架,推动「强化学习用于大语言模型(RL4LLM)」迈向新范式。Async架构提升GPU利用率,AsyPPO降低计算资源消耗,Attention机制提升训练效率与可解释性。

机器之心
算法论文8

Embedding黑箱成为历史!这个新框架让模型“先解释,再学Embedding”

来自多高校研究人员推出可解释的生成式Embedding框架GRACE,解决传统文本表征模型黑箱式表征瓶颈。它重新定义对比学习信号,含三个关键模块,训练双模式统一,实验跨任务提升且不损生成能力。

量子位
新闻资讯8

Anthropic 发布 AI Agent 上下文工程指南

今年6月Andrej Karpathy提出用「上下文工程」取代「提示词工程」。Anthropic发布工程博客呼应此观点,指出构建AI应用重心转向策划上下文。文章详述上下文工程重要性、有效上下文剖析、检索及时任务应对技术等。

AGI Hunt
算法论文8

国科大 | 提出进化算法:EvolKV,自适应分配KV Cache,预算降至1.5%!

键值缓存(KV cache)是大模型快速运行核心技术,但输入文本,存储和处理问题越突出。国科大提出进化算法EvolKV,自适应分配KV Cache,实验显示其效果显著,预算可降至1.5%。

AINLPer
推荐文章8

AI三问:Agent、LLM、RAG,一文厘清!

文章介绍大语言模型(LLM)、检索增强生成(RAG)和AI智能体(Agent)三种架构。阐述其概念、工作原理、应用场景、优缺点,还做了横向对比,给出选用建议,最后提及混合架构与未来趋势。

MCP Lab
开源动态7

DeepSeek R1 迎来小更新大升级,性能直逼 OpenAI o3!

昨日,DeepSeek 发布 R1 大模型最新版本 DeepSeek - R1 - 0528 并开启公测。虽官方未附详细技术说明,但用户反馈推理和输出有改进,也有性能方面的不同看法,其在基准测试表现佳。

AI科技大本营
算法论文8

因果发现大模型迎来「理论破局」: DAG-FM 破解异质机制下的因果图识别与涌现难题 | GAIR Paper 116

浙大、清华与稳准智能联合发布因果发现大模型DAG - FM,解决了现有模型缺乏理论基础、易产生非法环路和显存爆炸问题。它在理论上证明因果图可识别,架构上避免环路,处理数据能力强,还将推进特定领域预训练

AI科技评论