「办公能力升级」共找到 3832 篇相关文章
GPT-5编程测评大反转!表面不及格,实际63.1%的任务没交卷,全算上成绩比Claude高一倍
Scale AI的新软件工程基准SWE - BENCH PRO测试中,‘御三家’表面解决率低。深入看,GPT - 5已提交任务准确率比Claude高一倍。该基准新题多、更复杂,能真实考验模型能力,当前模型解决商业问题能力有限。
不到百万级,看不见 MCP 的真实问题:创始人亲述这疯狂的一年
MCP 联合创作者 David 复盘其发展,从开源协议到行业事实标准,经历多阶段演进。他指出做对死磕标准 HTTP,踩坑让关键能力成可选致双向能力被削,规模达百万级有扩展性问题,还谈及多方面发展与规划。
拒绝强行AIGC!| 一种安全实用、准确率高的Text2Sql方案
在金融、医疗等对精确性、透明度和安全性要求高的领域,完全依赖大模型NL - to - SQL能力易出错。本文提出基于函数调用LLM的新范式,将LLM能力聚焦于调用预定义功能函数,提升了数据检索的准确性、透明度和可维护性。
Openai-o3 做不到的事,7B 模型做到了! 推荐系统“慢思考”,广告收入暴涨 4.1%
随着GPT - 4等大语言模型兴起,LLM用于推荐系统遇瓶颈,当前方法停在‘System - 1思维’阶段。A4ec框架把LLM从‘快思考’升级到‘慢思考’,用7B模型实现推荐系统升级,使广告收入暴涨4.1%。
体验完微信Agent以后,我觉得这就是微信有史以来最大的更新。
作者获微信小微内测资格,深度体验后认为这是微信最大更新。微信Agent打通原生能力有超预期之处,但智能程度不足。功能上有亮点也有限制,如通讯录操作谨慎、小程序适配佳,还能生成小工具。
拆解 Claude 5.1:38 小时不睡觉的背后,Anthropic 正在终结「模型论」
Anthropic 更新 Claude 5.1,推出 Fable 5.1 和 Mythos 5.1,将‘智力’与‘权限’物理剥离。前者负责通用任务,后者面向专业场景。此次更新展示模型解决长时任务状态一致性等问题的能力,还体现了能力权限分离等变化。
全球AI双榜第一!力压谷歌Veo与Grok,Vidu Q3「参考生」之王归来
这个月初谷歌免费开放Veo 3.1视频生成能力,让AI视频更普及,但模型距‘能交付’仍有差距。Vidu Q3带着‘全家桶’回归,覆盖多领域,在权威评测榜单成绩优异,视觉、听觉和场景能力升级。
AI上清北,普通人该怎么办?|甲子光年
2025年AI模拟高考成绩达清北线,引发对人类努力意义的思考。三位嘉宾围绕AI能力进步、与人类能力差异、对教育和创作的影响等展开对谈,探讨人类在AI时代的定位、专业选择、教育变革等问题。
4万星开源项目被指造假!MemGPT作者开撕Mem0:为营销随便造数据,净搞没有意义的测试!
高人气开源智能体记忆项目Mem0在论文中称在LOCOMO上打败所有人,MemGPT联合创始人公开指控其测试无意义、数据造假。二者都为解决大模型长期记忆问题,Letta认为能力比工具重要,并给出评估智能体记忆能力的方法。
对谈黄灯:普通二本学生的出路在哪里?
高考季,与《我的二本学生》作者黄灯对谈二本学生出路。指出学历非唯一,能力和热情更重要。当下就业严峻,高校课程与社会需求脱节,二本学生应提升动手能力,利用AI工具,立足学校和当地找机会。