「上交大」共找到 5118 篇相关文章
更多thinking≠更好结果,精准thinking可砍掉一半长度
当前大模型如GPT - 4、DeepSeek推理又长又啰嗦,论文发现其在简单题目上过度推理。作者提出‘无效思考’概念,还给出解决原则,用LC - R1方法训练,效果显著,揭示精准思考才是王道。
ACL2025 | 代码助手火了,但安全吗?所有模型评估结果都很扎心
近期,GitHub Copilot、ChatGPT等AI代码生成工具爆火,效率显著提升,但代码安全性存疑。北大团队用CoV-Eval评测20款主流大模型,结果不佳,论文还给出优化方向,呼吁代码上线前严格测试。
Claude:Profile and Preference
文章借与Claude对话,探讨Profile和Preference概念,分析其区别联系,指出AI时代借助大模型理解用户的变化,还谈及数据源、实时个性化、偶然性、广告变革等问题,最后Claude为作者生成简易画像。
凭借 27 万小时真机数据,Generalist 可能是最接近“GPT-1 时刻”的顶级机器人团队
Generalist是机器人领域有潜力的公司,凭借27万小时真机数据或达GPT - 1量级,领先6 - 12个月。团队成员来自顶尖机构,技术强,demo展示出模型灵巧性。不过也面临Scaling Law不确定、数据缺口大、商业化场景缺失等风险。
音频全能王炸!小米MiMo-Audio开源,力压Gemini/GPT-4o!
小米团队开源通用音频大模型MiMo-Audio,集多种功能于一身,支持7国语言零样本克隆和中英混合合成。首包延迟低,效果自然稳定。在多个基准测试中表现优于Gemini-2.5-Flash和GPT-4o-Audio。
Agent搜索哪家强?人大高瓴&快手联合发布全新评测基准GISA
人大高瓴与快手联合发布全新评测基准GISA,用于评估智能体搜索能力。它解决了现有基准反向构造、评估维度单一、答案易被记忆等问题,含373个高质量查询,实验显示当前搜索智能体距人类水平差距大。
45亿红包打响AI入口大战,百度给出另一种回应
春节期间,国内外AI圈有两件大事,国外OpenClaw在GitHub爆火,国内大厂掀起AI春节营销大战。百度率先接入OpenClaw,并推出5亿红包活动。其采用搜索+AI策略,有全栈布局优势,想走长远发展之路。
8B 端侧写作智能体 AgentCPM-Report 开源,DeepResearch 终于本地化
1月20日,8B端侧写作智能体AgentCPM - Report开源。它以端侧模型为核心,实现本地化部署与SOTA性能双重突破,亮点在于极致效能、本地安全保障,在多评测基准表现出色,部署便捷,两大创新支撑其优秀性能。
“AI火了,我们却快完了!”顶级开源框架Tailwind之父含泪裁掉75%兄弟:半年后,这个项目可能就没了
前端开源项目 Tailwind CSS 面临生存危机,创始人 Adam Wathan 称因 AI 对业务模式冲击大,一天内裁掉工程团队约 75% 员工。如趋势不变,约 6 个月后无法发工资,这与它在 AI 领域受欢迎形成反差。
这种眼镜我建议外卖快递小哥人手一个
亚马逊为快递小哥配备智能眼镜“Amelia”,早期版本正实测。它基于先进技术,能扫描包裹、导航等,明年中期量产。亚马逊还或推消费级眼镜“Jayhawk”,与Meta竞争。今年AI眼镜赛道热闹,国内外大厂纷纷入局。