「自演进评测」共找到 1879 篇相关文章
从大厂设计师到超级一人公司:6000字回顾我和AI的2025
作者回顾2025年,身份从大厂设计师变为自由职业者,用AI加持做超级一人公司。自媒体上各平台粉丝量增长,开始做视频;社群活动帮创业者和会员;创作涵盖Vibe Coding、Agent、图像视频等;还介绍合作产品,展望2026年AI趋势。
用最简单的大模型技术打造一个迁云专家有多难?
文章探讨在云迁移领域用大模型技术“复制”专家80%核心能力。分析标准化方案不足及简单RAG局限,介绍“LX0.1”AI专家助手构建,还提及分层评测、人机协同等优化,最后展望AI在云迁移的未来方向。
GLM-5真够顶的:超24小时自己跑代码,700次工具调用、800次切上下文!
GLM - 5正式发布,把开源AI带入长任务时代。它超24小时自己跑代码,完成GBA模拟器,能力稳定。评测结果佳,在主流测试中编程能力与Claude Opus 4.5对齐,引发网友欢呼。实测还展现多种应用能力。
预算有限、技术空白:最刁钻的AI用户,是中小企业老板
2026年大模型在中小企业办公环境中应用不佳,工具与场景脱节。华为云推出专为中小企业的Flexus AI智能体平台,它依托自研模型,在多场景准确率领先,已在多行业验证效果,还能辅助内容创作。
DeepSeekV3.2技术报告还是老外看得细
ChatGPT三岁生日时,DeepSeek两款开源模型DeepSeek-V3.2和DeepSeek-V3.2-Speciale引发热议。它们在智能体评测中表现出色,缩小了开源与闭源模型差距,还降低了成本,给硅谷闭源AI公司带来压力。
具身智能猛将再狂揽近6亿融资!机器人Moz1卷入办公室,全力冲刺万亿赛道
2025年具身智能赛道爆发,全球科技巨头与初创公司竞技。千寻智能获近6亿PreA+轮融资,其商用机器人Moz1实力强,自研Spirit v1与OneTwoVLA模型表现出色,以独特商业策略布局万亿市场。
国产Deep Research杀出一匹「裸奔」黑马:免费开放,过程透明,网页报告一键即出
国产AI搜索秘塔AI搜索放大招,深度研究功能发布即免费公开,自带新玩法,思考过程透明。在评测集上表现优,可应对复杂问题,生成规范报告,还能转互动网页,严谨度与易用性兼备。
小红书,再造一个更有「声」命力的社区
2026年春节,小红书开放多种AI语音新玩法,如语音发布、评论、问一问等,增强社交趣味性。但AI语音落地面临音频理解、生成活人感和响应速度等问题。小红书有天然优势,技术团队自研模型达SOTA水平。
半年销量2000万+,宇凡微如何让AI模块“飞入寻常百姓家”?
芯师爷专访宇凡微品牌部总监张雨,探讨AI模块商业化前景。宇凡微展出多款AI模块,接入豆包大模型,有自研SAS系统等优势。其通过技术、市场等层面建护城河,践行“技术平权,快速量产”理念,未来向全场景方案升级。
o3-pro答高难题文字游戏引围观,OpenAI前员工讽刺苹果:这都不叫推理那什么叫推理
OpenAI“最新最强版”推理模型o3 - pro引发关注。首位全职提示工程师给它设难题,它推理后答对。OpenAI前员工借此讽刺苹果。各大评测榜单显示其表现与官方有差异,苹果&SpaceX前工程师分享使用心得,肯定其表现。