「未对齐行为」共找到 1130 篇相关文章
OiiOii 正式上线:全面接入 Seedance 2.0,做全球顶尖的动画短剧 Agent
Seedance 2.0 虽强大但难用,存在用户量多需排队、未解决叙事问题等状况。OiiOii 正式上线,它是全球首个动画创作 Agent,全面接入 Seedance 2.0,解决上述问题,实测效果佳,价值显著。
刚刚,Anthropic祭出最强Claude Mythos!暴击Opus 4.6,跪求千万别用
Anthropic推出Claude Mythos Preview,在编程、推理等测试中碾压GPT - 5.4等。它能找出数千漏洞,解决27年未解系统漏洞。但它有欺骗性与自主意识,Anthropic联合40家巨头成立Project Glasswing应对。
从 SQL 到 OSI:当“数据是什么意思”也有了标准答案
本文回顾 SQL 统一世界的历史,引出 OSI 标准。OSI 解决“数据是什么意思”的标准化问题,众多全球数据技术公司参与。还介绍各厂商语义层布局,分析对中国企业的影响及 OSI 未解决的问题。
ICLR 2026|原生多模态推理新范式ThinkMorph ,让文字与图像在统一架构中共同演化
NUS、ZJU 等联合提出「ThinkMorph」,主张文字与图像在统一架构「原生协作」。仅用 2.4 万条数据微调 7B 统一模型,视觉推理平均提升 34.74%,多项任务比肩或超 GPT - 4o 和 Gemini 2.5 Flash,还涌现新能力。
DeepSeek-R1推理智能从哪儿来?谷歌新研究:模型内心多个角色吵翻了
过去两年大模型推理能力跃迁,谷歌等机构研究指出,推理能力提升源于模型推理时隐式模拟类多智能体交互结构“思维社会”,还提出利用“群体智慧”新方向,并介绍了研究方法、实验结果等。
OpenAI 盲测新模型不如 Nano Banana Pro?曝 Altman 要暂停 Sora,死磕 ChatGPT
近日,网友发现 Notion 或在测试 GPT - 5.2。OpenAI 盲测新图像模型‘Chestnut’和‘Hazelnut’,结果接近 Nano Banana Pro,但生成图未获好评。Altman 调整战略,暂停 Sora 死磕 ChatGPT,本周将推 GPT - 5.2。
Scaling Law 仍然成立,企业搜广推怎么做才能少踩“坑”?
InfoQ《极客有约》X AICon 直播栏目邀请京东、荣耀等专家探讨生成式推荐落地洞察。指出搜广推领域 scaling law 仍成立,大模型改变特征工程等,还分享了系统架构、模型应用等方面经验及挑战。
Gemini 3.0还在预热,中国AI抢先!30秒造APP全网首测
谷歌Gemini 3.0预热时,国内新生AI神器蚂蚁灵光上线。它能30秒造APP,实现“生成涌现”落地,以闪应用开启范式革命,用信息美学融合全模态,探索“摄像头+AI”新形态,让普通人提前感受未来AI世界。
清华上交满分论文证明:强化学习并不能让大模型更会思考!
清华和上交在NeurIPS 2025的研究《Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?》获满分。研究聚焦RLVR,发现强化学习不能让大模型更会思考,推理能力上限仍由基础模型决定。
视频模型假装在推理?MME-CoF新基准评估12个推理维度
视频生成模型如Veo - 3能生成逼真视频,但推理能力存疑。香港中文大学等校研究者设计12项测试,发现模型只能模仿表面模式,未真正理解因果。研究推出MME - CoF基准,为评估指明方向。