「功能测试」共找到 3149 篇相关文章
时隔一年,再次使用7个国产AI大模型写高考作文,国产模型的进步也太大了!有彩蛋。
去年评测国产模型写高考作文能力时,各模型问题不少,如用词重复、字数不足。今年再次测试7个国产模型,能力有指数级提升,文采惊人,扣题方面通义千问和文心一言表现出色。文末还有海外模型“翻车”彩蛋。
马斯克的xAI以1130亿美元估值,出售3亿美元股权
金融时报消息,马斯克旗下xAI正以1130亿美元估值出售3亿美元股权,细节未全披露。若融资成功,其估值将跻身全球前列。xAI成立于2023年,获巨额融资,与X合并,产品Grok AI功能丰富。
真6,上线几天,轻松斩获10k,首款开源通用AI智能体Suna:一句话自动处理Excel/爬数据/写报告,程序员私人助理诞生!
Suna是Kortix推出的全球首个开源通用型AI Agent,核心突破是“执行力”,能像人类员工操作数字工具。它开源透明,是全能数字员工,已落地多场景,有五大核心功能。还给出部署方法和同类对比。
多模态大模型不会画辅助线?最新评估得分:o3仅25.8%,远低于人类82.3% | 清华腾讯斯坦福联合
清华、腾讯、斯坦福等团队发布RBench - V基准测试,评估大模型视觉推理能力。结果显示,主流大模型如o3、Gemini2.5等准确率远低于人类,开源模型表现更差,暴露出大模型在复杂多模态推理任务中能力不足。
前后端一起消失:AI Coding正在改写大厂工程师分工
大厂研发组织出现调整,美团前后端团队合并,蚂蚁网商让测试岗转研发岗。AI Coding普及使技术岗位划分重塑,前后端边界成“全栈能力”。AI编程工具虽有后端执行能力,但仍需资深工程师兜底。
破天荒!DeepSeek V4正式版居然要涨价,而且翻着倍地涨
DeepSeek官方邮件称7月上线V4正式版,高峰时段API各类token价格翻倍,但其他时段仍维持低价。此前它一直以低价著称,此次涨价或与算力紧张、自建数据中心有关,且更新将带来功能优化和性能提升。
OmniWork:面向创作者的 Agent OS
文章介绍了面向创作者的 Agent OS OmniWork,它的 Agent 围绕专业方向定制,Expert 和 Skill 可自行创建,能多 Agent 协作。通过实例展示其从热点捕捉到生成 BP、文章创作等功能,还介绍了底层逻辑,适合创作人群。
Qwen3.7:智能体新前沿
阿里云正式发布面向智能体时代的Qwen3.7-Max模型,将通过API提供服务。它能力全面,编程、办公、长周期执行等表现出色,适配多框架,在多场景评测中领先,能驱动生产力跃升,还经多实战测试验证实力。
没绷住...美团竟然做了个这?
美团推出产品 xia345,它聚合主流 AI Agent 客户端、技能市场和 LLM 模型等信息,功能不复杂但信息密度高。其有清晰新手路径,还能成 Agent 技能。产品经理规划了新功能,目标成 Agent 时代迪士尼乐园。
跑分第一,推理暴跌!Claude Opus 4.7上线48小时口碑崩了
Claude Opus 4.7发布48小时口碑两极撕裂。官方榜单并列全球第一,但逻辑推理公开测试成绩暴跌,token消耗涨35%,旧接口报错,用户吐槽「更贵、更蠢、更爱顶嘴」,Anthropic虽解释却难平用户怒火。