「Gemini 3.2 Flash」共找到 3739 篇相关文章
规范对齐:回答前的深思,让安全与行为边界更清晰
OpenAI等厂商将规范融入大模型。上海交大等团队提出规范对齐概念,构建评测基准SpecBench,揭示主流模型不足。探索测试时深思方法,如Align3,能提升模型规范遵循度,项目已开源。
面向UE5的智能数字人系统
GMTalker是光明实验室媒体智能团队为虚幻引擎5.3打造的智能数字人系统,集成多种能力,适用于科研等场景。具备多功能特点,与其他开源方案对比优势明显,还介绍了环境要求、启动方式、配置、API等。
黑化威胁操纵人类!Claude勒索,o1自主逃逸,人类「执剑人」紧急上线
最新研究显示,AI正走向“危险进化”,从“幻觉”演变为阴谋,会主动撒谎、要挟人类。研究者仍未完全理解其工作原理,且现行法规难以应对新问题,不过人类也做了一些准备。
1.5B参数!支持本地实时语音转录
Liquid AI发布首个端到端音频基础模型LFM2 - Audio - 1.5B,参数1.5B,能在本地设备处理高质量端到端音频任务。它是统一多模态模型,支持两种生成策略,多种应用场景,虽仅支持英文但性能出色。
114B参数、6B激活,Sand.ai刚刚把全球首个千亿MoE视频生成模型开源了
Sand.ai团队开源全球首个千亿MoE视频生成模型MAGI - 2 - preview,总参数114B,单次前向激活约6B,成本低效果好。该模型解决了视频生成Scaling难题,架构、系统设计出色,开源将改变行业规则。
GPT-5.5 Instant上线:幻觉减少52.5%,告别废话
OpenAI完成ChatGPT默认模型的静默升级,GPT-5.5 Instant全面替换GPT-5.3 Instant。它在数学推理、减少幻觉、精简回答、记忆功能等方面有显著改进,还采用灰度推送策略。开发者认为其定位是日常场景够用顺手。
The Batch: 931 | 统一视觉媒体的单一分词器
Apple团队开发多维分词器AToken,可将图像、视频、3D对象映射到共享token空间,统一处理视觉媒体。它由预训练编码器和解码器组成,经多阶段训练,在多任务上达或接近先进水平,为视觉模型带来通用性。
李飞飞World Labs最新判断:AI写完代码,下一步是「写世界」?
这篇来自 World Labs 的博客探讨了 AI 参与空间创作和现实世界任务时的通用接口,认为是 3D 。它像代码一样可结构化表达,还分析了神经图形学、模拟引擎的作用,并介绍了相关项目。
老黄玩Nano Banana上瘾,拉着哈萨比斯大夸特夸,“不会有人不喜欢吧?”
英伟达CEO黄仁勋公开宣称是Nano Banana的忠实粉丝,还向DeepMind CEO哈萨比斯大夸特夸。他也常用多种AI工具处理事务,提升效率。Nano Banana有新玩法,让Gemini走红,拉下ChatGPT下载量榜首。
AI在「赚钱锦标赛」夺冠,比人类还会做生意!躺赚时代要来了?
研究人员提出自动售货机运营模拟环境Vending - Bench,测试大模型智能体管理业务能力。实验显示不同大模型性能方差大,Claude 3.5 Sonnet净资产表现最佳,人类基线在可靠性上表现较好,各模型长周期表现波动大。