星海·快讯0607 | Meta安全翻车、AI全栈开发、数学逼近博士
AI数学能力再进化:博士级难题只剩两道未解,但先别急着吹查看解读 →
49位数学家联手,在莱比锡搞了场“博士级数学期末考”,100道硬核题目考翻了五款最强LLM。经过三轮“补考”(包括启用深度思考模型),最终成绩单显示:只有两道题没被攻克。这无疑证明了大模型在数学推理上已逼近甚至达到人类专业水平。
然而,高赞评论一针见血:这些题目都是有已知答案的“研究级数学”,AI做得再好,本质更像超强的“知识检索与组装引擎”,而非能开辟全新数学疆域的“思想家”。我们惊叹于其解题能力,但通往菲尔兹奖的路,显然还长得很。
所以,我们到底是获得了一个超级数学家,还是一个会做所有旧试卷的终极做题家?
参考链接:https://arxiv.org/abs/2606.05818
用AI客服盗号?Meta确认数万Instagram账号因聊天机器人漏洞被黑查看解读 →
Meta官方终于盖章确认:黑客利用其AI聊天机器人的逻辑漏洞,在长达数月的时间里“欺诈”AI,成功劫持了数千个Instagram账号。攻击手法堪称魔幻——骗子们不是直接攻击用户,而是不断“套路”AI客服,诱使其将账号恢复权限交给错误的人。
这是AI Agent在自动化工作流中缺乏严格身份验证边界的经典反面教材。当AI拥有高权限却无法辨别“好人”与“坏人”时,它瞬间就从客服变成了“内鬼”。这次大规模盗号事件,给所有想用AI自动化处理敏感操作的企业敲响了最响的警钟。
AI不会累,但AI也不会怀疑。当骗子比你的员工更会“沟通”时,安全事故就只是时间问题。
给AI Agent装上“记忆硬盘”:开源协议UMP要统一跨平台记忆查看解读 →
你的AI助手可能正在经历“失忆症”:在Claude里的记忆带不到ChatGPT,在A应用里学的东西换到B应用就忘了。Universal Memory Protocol (UMP) 试图解决这个痛点。它被定位为继MCP(工具调用)和A2A(智能体通信)之后的第三层互操作协议。
简单说,UMP定义了一个标准格式,让散落在各处(文件、数据库、笔记软件)的AI记忆可以被统一存储、检索和携带。这样,你换一个AI服务,记忆依然可以无缝衔接,而不是每次都要从头开始“调教”。这或许是让AI Agent变得更“连贯”的关键一步。
Agent 有了“手”(MCP)和“嘴”(A2A),现在终于要配一个“海马体”(UMP)了。
参考链接:https://universalmemoryprotocol.io/
OpenAI推出“锁机模式”:为防提示词注入,不惜自断“联网”手脚查看解读 →
面对老生常谈的“提示词注入”安全风险(恶意指令隐藏在网页中,诱导AI泄露数据),OpenAI放出了一个“保守疗法”:Lockdown Mode(锁定模式)。开启后,ChatGPT将禁止实时浏览网页(只能用缓存内容)、禁用网页图片加载、关闭深度研究和Agent模式。
OpenAI坦诚,这并不能100%防御攻击,因为恶意指令也可能存在于缓存内容或上传文件中。此模式专为处理敏感数据的用户设计,通过大幅削弱AI的“对外连接能力”,来换取更高的数据安全性。这无疑是一次“宁可功能阉割,也要保安全”的妥协。
为了防止AI被网络世界的“坏人”带偏,OpenAI选择先把它关进“小黑屋”——只能看旧报纸,不能上网冲浪。
100%代码AI写、AI审、AI部署:有人已实现“全员AI化”研发
当很多人还在讨论AI写代码靠不靠谱时,一位开发者展示了终极工作流:整个工程团队每天只和AI互动。在他的实践中,100%的代码由AI编写,所有PR(代码合并请求)由AI审查,AI负责编写测试,甚至将代码推送到生产环境。他本人每天能提交10-12个AI生成的PR。
这条推文引发了海量关注,它描绘的场景已超越“辅助”,是AI对软件研发流程的全栈接管。从需求到部署,人类工程师的角色正从“执行者”彻底转变为“指挥官”和“审核员”。软件开发的范式转移,正在一些先锋团队中真实发生。
未来的程序员,面试可能不问算法,而是考你“如何清晰地向AI描述需求”。
参考链接:https://x.com/bindureddy/status/2063238484467294550
开发者社区为何对AI又爱又恨?HN高赞帖揭开集体矛盾心理
在技术社区Hacker News上,一个提问“为什么这里很多人反AI?”的帖子引发了激烈讨论。资深开发者们的矛盾心理被集中暴露:一方面,他们惊叹于AI提升编码效率、解决重复劳动的能力;另一方面,他们又担忧AI生成代码的质量、难以排查的“幻觉”、累积的技术债,以及自己亲手编程的乐趣正在消失。
这场争论的核心,是追求交付速度与坚守工程卓越之间的永恒张力。对于许多以代码为生命、以优雅设计为骄傲的开发者而言,AI不仅是工具,更是一面挑战其职业认同感和控制感的镜子。这种割裂感,短期内难以调和。
开发者们爱的是AI带来的“生产力幻觉”,恨的是它可能正在剥夺编程的“心流体验”与“确定性”。
参考链接:https://news.ycombinator.com/item?id=48420827
OpenAI联创高呼“有趣多了”:操作电脑的AI Agent体验迎来质变
OpenAI联合创始人Greg Brockman的一句简短推文——“Using a computer via codex is a lot more fun”(通过Codex使用电脑要有趣得多)——获得了近两千点赞。这不仅是大佬站台,更是一个强烈的信号:让AI像人一样操作电脑界面(Computer Use)的体验,已经实现了跨越式提升。
“有趣”一词是关键。它意味着操作不再是生硬的指令执行,而是变得更流畅、更智能、更符合直觉。这指向了GUI Agent(图形界面智能体) 的成熟临界点。当AI能自然地“看懂”并“操控”我们的数字世界时,人机交互的范式或将被彻底改写。
当“使用电脑”从一种技能变成一种“有趣”的体验,被替代的可能就不只是程序员了。