「语言指令」共找到 1345 篇相关文章
让AI打游戏!能玩1000多款游戏,英伟达用4万小时视频训练出通用基础模型NitroGen
NVIDIA发布NitroGen模型,利用40000小时带按键显示的游戏视频,构建视觉-动作数据集,训练出能玩超1000款游戏的通用基础模型,在跨游戏泛化和微调任务中表现卓越,为具身智能发展提供新思路。
X爆火Overleaf科研辅助神奇PaperDebugger
当下学术写作借助大语言模型辅助时,流程繁琐且上下文易丢失。新加坡国立大学团队推出的 PaperDebugger 是基于插件的多智能体系统,寄生在 Overleaf 编辑器内,可完成多任务,解决现有工具不足。
刚刚,OpenAI发长文:找到缓解LLM撒谎的方法!
Google发布Gemini 3 Deep Think,ARC - AGI - 2准确率高且采用并行推理技术。OpenAI发长文《通过忏悔训练大型语言模型诚实性》,介绍缓解LLM撒谎的忏悔训练法、实验结果等,也指出其局限。
商汤科技与南洋理工大开源空间智能多模态SOTA模型
商汤科技与南洋理工大学构建800万量级三维空间数据集,训练出开源SOTA多模态基础模型SenseNova - SI系列。该系列模型在多个权威测试中表现出色,部分超越GPT - 5,还展现出泛化等能力,且能赋能具身智能。
Agent 如何用搜索?这家最懂 AI 搜索的团队,把踩过的坑都分享出来了
AI时代搜索与传统搜索大不同,人类搜索是静态检索,AI搜索是动态、流式、可追问的。小宿科技作为AI Agent基础设施提供商,分享了为Agent提供搜索服务的经验,包括不同场景下AI应用接入搜索的难点与解决方案。
Voices 能够让 Java 应用程序快速实现文本到语音转换
Voices 是开源文本转语音项目,为 Java 17 及以上应用设计,无需外部 API 或手动安装软件。可按字典或 OpenVoice 为不同语言生成音频,其使用 ONNX Runtime 加速,还介绍了使用方法和配置。
一边秀肌肉,一边设围墙,NVIDIA 发布 OmniVinci,性能碾压 Qwen2.5-Omni,却被骂“假开源”
NVIDIA 推出多模态大语言模型 OmniVinci,结合架构创新与数据合成流水线,训练 token 仅为 Qwen2.5 - Omni 的六分之一,却在多项基准测试表现更佳。但采用限制商业用途的许可证,引发争议。
内存直降50%,token需求少56%!用视觉方式处理长文本
在NeurIPS 2025论文中,南京理工大学等校研究团队提出VIST框架,为大语言模型长文本高效推理提供视觉解决方案。它模仿人类阅读机制,让模型具备选择性阅读能力,减少Token需求和内存使用。
Seedream 4.0大战Nano Banana、GPT-4o?EdiVal-Agent 终结图像编辑评测
在AIGC下一阶段,图像编辑成检验多模态模型关键场景。研究者提出EdiVal - Agent评估框架,能自动化生成指令并多维度评估编辑结果,其评估与人类判断一致性高,还对比了13个模型的多轮编辑表现。
告别微调!腾讯提出Training-Free GRPO:无需更新参数,还能保证泛化性,成为传统RL的有力替代
大型语言模型在专业领域表现不佳,传统微调方法成本高、易过拟合。腾讯优图实验室提出Training - Free GRPO,无需更新参数,通过上下文学习提升性能,成本低且泛化性好,是传统强化学习有力替代。