「用户质量」共找到 2013 篇相关文章
刚刚,GPT-5.5 Instant全员免费!数亿人的ChatGPT变了
OpenAI深夜推出GPT - 5.5 Instant,全面接管ChatGPT默认模型且全员免费。它亮点诸多,如幻觉率暴降、数学成绩提升、回复字数减少、记忆和个性化功能升级等,三个月后GPT - 5.3将退役。
最新!Karpathy:Vibe Coding只是抬高了地板,真正的战场在这里
Andrej Karpathy在AI Ascent 2026上与红杉合伙人对话,分享自提出“vibe coding”一年来的变化。谈到技术转变、Software 3.0、模型“锯齿状”特征等,还区分了vibe coding和agentic engineering,指出人类需保留品味、判断力等。
设计行业天塌了!Anthropic再推王炸产品Claude Design:设计稿、原型、PPT一句话搞定
Anthropic推出平台级产品Claude Design,用Claude Opus 4.7模型助力设计。它能让各类用户完成视觉内容创作,有多种使用场景和便捷工作流程,还给出内部设计师使用建议。
Claude Opus 4.7 上手实测:花7倍价格买输出,值不值?
作者实测Claude Opus 4.7,其定价约为GPT - 4.5的6 - 7.5倍。它有全新架构、强化Agent能力等升级,在代码生成、推理分析等多场景表现出色,是否值高价取决于使用场景。
首创郎园发布五大举措,构建AIGC视听产业全域创新体系
4月17日,首创郎园总经理赵春燕在北影节发布AIGC视听产业朝阳全域创新生态体系,推出5大核心举措,构建完整文化IP市场,激活创新模式潜力,推动大视听产业高质量发展。
Claude Code 桌面版烂爆了,Anthropic 终于把 “100% AI 编码”演砸了
Anthropic将Claude Code做成桌面应用,本值得期待,然而新桌面版却问题频出,如卡顿、崩溃、自动化功能不稳定等,还出现大量基础功能问题。此前Anthropic宣称代码由AI编写比例高,但产品质量堪忧。
ACL 2026 | OPeRA Dataset: LLM真的能模仿人类行为了吗?首次系统评估LLM的人类行为模拟能力
美国东北大学等机构研究者提出OPeRA数据集,采集真实用户在线购物行为,支持系统评测LLM个体化行为预测能力。实验显示当前主流LLM在模拟人类行为上表现有限,揭示其能力边界。
Lovart 4个独家设计新功能:一人公司品牌设计半小时搞定,你挑挑刺
Lovart 迎来重磅更新,其功能专为一人公司品牌设计定制。用户可创建专属字体、建立品牌套件、批量出物料、保存流程到 Skill 及导出 PSD,打通 AI 生成与专业精修断层。
去掉像素中介!上海交大让AI边看边想边画,用同一个“大脑”跨模态推理
上海交大等团队提出LatentUM架构,摒弃像素解码中介,在共享语义潜空间跨模态思考。它用MBAQ技术转化视觉特征,设计MoME架构,还能自我反思、规划路线、模拟世界演变,表现出色。
达尔文.skill正式发布,一个无限进化的skill系统!
作者受Karpathy的autoresearch启发,开发了达尔文.skill系统,可自动评估和优化skill。它有五条原则、八维度评分体系,能批量解决skill质量问题,与Anthropic官方工具互补,现已开源。