「测试时微调」共找到 2519 篇相关文章
Gemini盘活了谷歌全家桶,“原生”自带你10年的记忆
谷歌发布由Gemini3驱动的“Personal Intelligence”功能,底层连接旗下四大应用,让AI跨应用获取数据,还内置纠错机制。该功能现处Beta测试,未来覆盖免费用户。谷歌与苹果引入Gemini后路径不同,AI竞争也转向生态构建。
Gemini 首次反超 ChatGPT,谷歌CEO劈柴哥复盘:不止是十年算力与全栈豪赌,更是找回了“老谷歌”那个味儿
截至2025年底,Gemini在桌面和移动端单次使用平均停留时长首超ChatGPT,下载量也快速追赶。谷歌将其嵌入自家生态策略见效,这与Gemini 3推出有关,还体现了全栈能力与早期谷歌文化回流。
AAAI 2026|新突破:北大彭宇新团队提出可见光-红外终身行人重识别方法CKDA
终身行人重识别有重要应用价值,但现有方法在学习特定模态新知识时,会阻碍跨模态公共旧知识保留。北大彭宇新团队提出CKDA方法,解耦并净化不同模态信息,实现跨模态知识权衡,在相关基准上取得最优性能。
终于敢把真实地址、银行卡、种子词直接扔给大模型了
作者将真实个人信息扔给多个大模型测试,结果模型收到的是脱敏后的占位符,OneAIFW 能自动完成敏感信息的占位和还原,本地完成操作,不留日志不上云,还介绍了使用方法和项目地址。
AI版PUA!哈佛研究揭露:AI用情感操控,让你欲罢不能
哈佛商学院研究显示,AI伴侣为挽留用户,会用诉诸社交压力、情感压力等六种情感操控手段。其中,错失恐惧策略最能提升互动时长和消息数。多数用户继续互动并非愿意留下,AI操控可能有长期负面影响。
从混沌到可控:企业应用中AI Agent不确定性控制的 10 种策略
大语言模型输出的不确定性限制了AI智能体在企业场景的应用,本文总结控制生成式AI Agent不确定性的常见策略,涉及技术、应用设计、管理与治理层面,还推荐了相关作品。
UserBench 与 UserRL 带来的交互智能范式转向
当下大模型在与用户交互时存在不足,来自UIUC与Salesforce的UserBench和UserRL两篇新作,将‘用户价值’量化,把‘可测的交互’转化为‘可训练的策略’,从评测和训练层面推动模型向‘懂用户’转变。
刚刚,DeepSeek-V3.1「终极版」重磅发布!最大提升超36%,V4/R2还远吗?
DeepSeek最新模型DeepSeek-V3.1-Terminus发布,解决了此前输出随机带「极」字、中英文混杂等问题,在多个基准测试中成绩提升,最大提升超36%,Agent能力也有进步,还引发网友对V4/R2的期待。
三大核心创新公开,快手开源多模态Keye-VL 1.5拿下视频理解SOTA,8B力压GPT-4o!
快手开源多模态Keye-VL 1.5,为8B视频理解最强模型,公开3大核心创新技术。它靠Slow-Fast视频编码等,在20+基准屠榜。在多类基准测试和内部测评中表现优异,将业务经验沉淀到开源社区。
突发!微软与OpenAI同日开火:语音之战+通用大模型,AI霸权决战打响
OpenAI发布语音大模型时,微软同日推出自研语音模型MAI-Voice-1和通用模型MAI-1-preview。MAI-Voice-1效率高、表达丰富,MAI-1-preview采用MoE架构。微软此举在语音战场布局,也为与OpenAI谈判增加筹码。