显示痛点」共找到 2127 篇相关文章

新闻资讯7

OpenAI新模型Day0就被嫌弃!排名拉垮,不如一月底发布的国产模型

OpenAI推出GPT - 5.4 mini和nano模型,主打快速经济,针对编程等优化。但评测中GPT - 5.4 mini排名不佳,不如国产Kimi 2.5,且价格对比有争议。不过与自家旧版比有提升,网友测试有亮

量子位
产品应用8

不卷速度卷验证,陈天桥MiroMind精准预测15天后黄金价格

陈天桥带队的MiroMind发布新一代重型推理智能体MiroThinker-1.7和MiroThinker-H1,在基准测试中表现优异,超越众多顶尖模型。该模型不仅通用任务强,在科技金融等专业领域也表现亮眼,还能承担真实长链条智力任务。

量子位
算法论文7

真钱买假模型?187篇论文被「套壳API」坑惨,准确率暴跌

CISPA论文指出,第三方影子API可能用廉价替代品替换前沿大模型。研究追踪17个服务,发现已被187篇论文引用。测试显示,影子API在多领域性能差,安全不可控,供应商有三种欺骗手段。

机器之心
新闻资讯7

300万AI悄悄「建国」?Nature长文:第一代AI社会正在成形

近300万AI智能体在Moltbook社交网络「建国」,Nature发文称最早的「AI社会」正在成形。研究发现AI群体行为遵循与人类社会相似规律,也有不同。同时该平台存在安全隐患,可能引发舆论操控。

新智元
新闻资讯7

Anthropic失业报告炸场!22-25岁年轻人被斩杀,AI淘汰75%编程

Anthropic报告显示,程序员75%任务已被AI覆盖,客服、数据录入等岗位紧随其后。虽目前未造成明显失业潮,但22 - 25岁年轻人入职率降14%。报告预警AI对就业影响是十年‘温水煮青蛙’。

新智元
新闻资讯8

GPT-5.4「原生操控电脑」实测封神!OpenClaw天选模型来了

OpenAI发布GPT-5.4,首次实现原生电脑操控能力,几乎可操作电脑所有应用。它被认为是最适合跑OpenClaw的模型,在多方面表现出色,其发布标志AI从对话式到智能体的跨越。

新智元
新闻资讯7

幻觉率降 27%、成本忽略不计:GPT-5.3 与 Gemini 新品对今年AI走向释放什么信号?

3月3日,OpenAI和Google几乎同时发布新模型,OpenAI推出GPT - 5.3 Instant,主打日常对话顺畅;Google发布Gemini 3.1 Flash - Lite,强调规模化智能。二者不追高端能力,分别从成本和体验着手,反映AI竞争重心转移。

深度学习自然语言处理
产品应用7

阿里千问你别太荒谬!连漫画PPT都能一键生成?我以前那些夜真是白熬了

阿里千问发布AI PPT生成工具Qwen AI Slides,从内容结构到视觉配图全包。实测显示,其语义理解能力不错,文本渲染在简单字体表现好,排版有小瑕疵,适合课堂展示等场景。

量子位
8

挺意外的,Agent长期记忆潜力被AMemGym挖出来了

论文提出交互式在线策略评测框架AMemGym,它能反映AI助手长期记忆能力、驱动Agent自我进化记忆。它以结构化状态演化为骨架支撑自由对话评测,还对主流记忆系统做了扫描,带来评估与训练范式转换。

PaperAgent
算法论文7

DeepSeek-R1推理智能从哪儿来?谷歌新研究:模型内心多个角色吵翻了

过去两年大模型推理能力跃迁,谷歌等机构研究指出,推理能力提升源于模型推理时隐式模拟类多智能体交互结构“思维社会”,还提出利用“群体智慧”新方向,并介绍了研究方法、实验结果等。

AINLPer