「大模型榜单」共找到 9424 篇相关文章

产品应用8

感觉这次扣子 2.0 触碰了模型和工程的天花板

2026 年,真正好用的 AI Agent 应能拆解目标、推进过程和交付验收。扣子 2.0 正式发布,从“给指令的工具”变为“能干活的工作伙伴”,有技能和长期计划两大核心升级,还具备扣子编程功能,拓宽了 AI 能力边界。

MacTalk
新闻资讯7

当AI开始过度思考「hey」这个字…

两张对话截图展现语言模型缺陷,用户发简单问候,模型过度分析,从问候语正式程度到表情符号语义权重,这种过度分析让对话不自然,错过人类交流重点。

AI工程化
新闻资讯8

刚刚,马斯克发布Grok 4!全榜第一,年费飚到2万+

北京时间中午,马斯克现身 xAI 发布会发布 Grok 4,称其是世界最好的 AI。Grok 4 推理能力强,多类基准测试成绩领先,还在多方面能力获加强,已上线但付费昂贵。

机器之心
产品应用8

MiniMax M3 实测:第一流的模型,已经对执行层动手了

文章对 MiniMax M3 模型进行多维度实测。它强化 Coding 与 Agent 能力,能完成长任务,与 Sonnet 4.6 竞技各有优势,多模态能力强,价格有竞争力,MiniMax Code 意在争夺开发者工作流入口。

AI科技评论
算法论文8

行为记忆+认知记忆,中科大MemWeaver重构LLM个性化记忆

论文MemWeaver被The Web Conference 2026接收,它聚焦用户从隐式到显式文本交互时个性化生成的升级问题。提出将用户历史升级为层次化记忆,构建行为与认知双记忆模块,主实验表现优,消融实验验证其结构设计关键。

PaperAgent
新闻资讯7

创新中心 | “影视AIGC实战进阶”专题活动,亮相第八届初心榜!

AIGC全面融入影视产业,重塑创作方式等。‘AIGC影视应用专题对话’作为第八届初心榜青年视听展重要环节,将在首创·郎园Station举行,汇聚多领域力量探讨影视AIGC落地实践。

郎园Station
开源动态8

终于开源升级OmniGen2,统一多模态图像生成模型,真的惊艳。

OmniGen2是强大的开源统一多模态图像生成模型,针对文本和图像模态构建独立解码路径,运用未共享参数。新架构提升处理效率和质量,在图像编辑等任务表现出色,还有多技术特点。

开源AI项目落地
产品应用7

codex降智大bug找到了,一句话让它把智商找回来!

近日Codex被降智,网友监测其智商曲线下降。L站大佬发现大bug及解法,在全局agents.md加特定语句,可让它大幅恢复智商。测试显示,加语句后正确率提升,降智概率降低。

探索AGI
新闻资讯8

刚刚,GPT-5.1发布,OpenAI开始拼情商

深夜,OpenAI上线GPT - 5.1 Instant和GPT - 5.1 Thinking模型。前者更温暖智能、指令执行强,后者处理任务更高效易理解,语气温暖。模型将逐步推出,还发布系统卡附录。

机器之心
新闻资讯8

GPT-5.4「原生操控电脑」实测封神!OpenClaw天选模型来了

OpenAI发布GPT-5.4,首次实现原生电脑操控能力,几乎可操作电脑所有应用。它被认为是最适合跑OpenClaw的模型,在多方面表现出色,其发布标志AI从对话式到智能体的跨越。

新智元