「大模型后训练」共找到 9628 篇相关文章
一群年轻人,正在训练AI宠物的灵魂 | 甲子光年
文章讲述了芯宠工场团队训练AI伴宠Lito的过程。通过各种试验,Lito能做出预设外反应,其‘灵魂’在与人类互动中生长。团队面临功能与情感的抉择,市场上也有其他创业者挖掘AI情感陪伴赛道。
Qwen 3 VL 模型已并入 llama.cpp,ollama同步支持
近日,Qwen 3 VL 系列模型合并到 llama.cpp 项目,支持图像输入和多轮对话,解决了架构兼容性问题。功能已入主干分支,运行需足够资源。Ollama 最新版同步支持其本地化。
Google说,2026年AI Agent会有这五大趋势!
Google Cloud发布2026年Agent趋势报告,认为能改变业务的转折点是Agentic AI,总结了五大趋势,如人人都有Agent、流程自动化等,核心是让员工成Agent管理者和协调者。
PAS刊发西工大张伟伟教授智能流体力学重磅综述论文
西工大张伟伟教授团队受主编邀请,系统调研人工智能与流体力学交叉领域进展。通过科学计量学方法,展示发展脉络、现状与前沿方向,分析研究格局、梳理团队,为该领域提供全景图。
Talking-Critic奖励模型带来更自然的音频驱动肖像
近期音频驱动肖像动画技术发展快,但现有方法存在嘴型声音不对、动作不自然等问题。阿里提出Talking - Critic奖励模型,构建Talking - NSQ数据集,还提出TLPO优化框架,提升多维度表现,实验超现有SOTA方法。
连OpenAI都在偷偷重仓!大模型的下一站,是「入侵」人类大脑
AI巨头入局使脑机接口升温,格式塔科技获1.5亿融资刷新中国纪录。全球超声赛道投资热,OpenAI等参与。超声波路径优势多,格式塔聚焦医疗,产品有望落地,AI融合是关键,未来脑机接口或成基础设施。
不用额外缓存!英伟达开源大模型记忆压缩方案,128K上下文提速2.7倍
英伟达联合多机构推出TTT - E2E方法,在长文本处理上提速显著且性能不打折。它基于标准Transformer,将长文本建模转为「持续学习」任务,核心是上下文压缩,避免额外缓存,代码和论文已开源。
ACL 2025杰出论文!用能力显著向量让大模型下游任务性能预测更精准
上海人工智能实验室与复旦大学联合研究成果《Capability Salience Vector》获ACL 2025杰出论文奖。提出能力显著向量(CSV)解决验证损失与下游任务能力脱节问题,实验验证其提升了下游任务表现可预测性。
金融大模型升级决策平台!马上消费发布“天镜”3.0破解经验碎片化难题
6月6日“2025消费金融生态大会”在重庆举行,马上消费常务副总经理蒋宁推出全面迭代的“天镜”3.0。它开启从个体到群体智慧跃迁,挖掘隐性经验,能匹配最佳服务路径,还具备协同进化能力。
ACL 2025 | 大模型乱试错、盲调用?KnowSelf让智能体有「知识边界感知」能力
ACL 2025 论文《Agentic Knowledgeable Self-awareness》聚焦提升智能体「知识边界感知」能力。KnowSelf 方法让智能体自主调节知识运用,实验显示其性能优,还探索了智能体自我认知多方面影响。