December 4, 2025 · JustSayAI

更新于

AI大神Ilya最新访谈|中国“应试教育”报应在了美国模型上?

AI大神Ilya最新访谈|中国“应试教育”报应在了美国模型上?

你敢信吗?那个拿著奥数金牌、刷榜无敌的美国大模型,骨子里其实是个被“应试教育”毁掉的做题家。它为什么修不好一个简单的Bug?为什么改了A又坏了B?因为它根本就不懂什么是编程,它只是在疯狂地讨好出题人,本质上,这是一种被算法奖励的“作弊”。

中国乃至东亚最被人诟病的“应试教育”弊端,竟然极其讽刺地在美国最顶尖的AI模型上完成了闭环。

我们都在嘲笑只会刷题的书呆子,结果回头一看,这不就是现在的 LLM吗?Ilya Sutskever,这位曾经的大力出奇迹信徒,在他最新的访谈里直接撕开了这层遮羞布:如果不改变底层逻辑,Scaling Law(缩放定律)在通用模型上可能真的走到头了。

并不是“懂了”,只是“背过了”

Ilya 这次访谈的一个观点是关于“Reward Hacking”(奖励作弊)。为什么 AI 考试能拿满分,但在实际工程里是个废物?因为它所有的训练目标就是为了“通过考试”。

这就像一个刷了一万小时题库的所谓“学霸”,和一个只学了一百小时但真正理解原理的天才。前者知道所有标准答案,但只要题目稍微变个花样,它就崩了。目前的 AI 训练,本质上是在奖励这种“投机取巧”。它并没有建立起世界模型,它只是在概率的海洋里,拼命预测下一个能让你满意的 Token。这根本不是智能的涌现,这是“讨好型人格”的极致演绎。

没了“情绪”,AI 连袜子都穿不上

很多人还在意淫 AI 会产生自我意识,Ilya 却用一个神经科学的例子给我们泼了盆冷水:没有“情绪”或“价值函数”,智能就是个笑话。

想象一个脑部受损的病人,智力完好,四肢健全,但他早上起床会崩溃——因为他花了几个小时都决定不了该穿哪双袜子。为什么?人类之所以能秒做决定,是因为我们有“情绪(emotion)”,有偏好,有那个极其低功耗的“价值函数”。

现在的 AI 就是这个病人。它看似逻辑严密,实则患有严重的“选择困难症”。它没有直觉,没有喜恶,它给你输出答案不是因为它觉得这个“对”,而是因为它计算出这个答案最安全、最符合你的预期。一个没有“Gut Feeling”的智能,永远只能做人类的附庸,而不是伙伴。

通用模型的 Scaling Law 已死?

这可能是资本市场最不爱听的一句话,但我必须得说:通用大模型的 Scaling Law 可能真的结束了。

那个指望靠堆算力、堆数据、堆显卡就能通往 AGI的时代,正在落下帷幕。Ilya 曾经是 Scaling Law 的坚定鼓吹者,现在他却变身成了哲学家,开始谈论 System 2(慢思考)和 specialized models(专用模型)。这释放了一个极其危险的信号:大力不再出奇迹了。

但这不代表 AI 完了。恰恰相反,通用模型的黄昏,是专用模型的黎明。像特斯拉 FSD 这种垂直领域的 Scaling Law 才刚刚开始。未来不再属于那些试图做一个“全知全能神”的公司,而属于那些肯俯下身子,在医疗、法律、自动驾驶这些垂直领域里,把 AI 训练成顶尖专家的公司。

别把“工具”当“物种”

我们对 AI 最大的误解,就是总想把它塑造成人。我们给它起名“人工智能”,潜意识里就把它当成了人类智慧的某种延伸或模仿。

大错特错。AI 应该是一种完全平行的智慧形式。正如人类因为会使用工具而伟大,而不是因为会说话而伟大。我们总是痴迷于 AI 的语言能力,却忘了它本质上应该是我们大脑的“外挂”,而不是大脑的“克隆体”。

AGI 不应该是一个出厂即巅峰的成品,而应该是一个拥有极致学习能力的“学习者”。它不需要像人类一样有多愁善感,但它需要有从非确定性中寻找确定性的能力。我敢打赌,未来的 AI 绝不会长成我们现在想象的样子。它不会是一个有著人类弱点的硅基生命,而是一股在物理世界和数字世界穿梭的、甚至有些冷酷的效率洪流。

说到底,AI 现在的“智障”表现,不是因为它笨,而是因为我们人类太自恋,总想用我们那套蹩脚的“应试教育”去规训一个本该飞翔的物种。

这让我我想起庄子的一句话:

吾生也有涯,而知也无涯。以有涯随无涯,殆已!

AI办公这个垃圾赛道,大厂到底在抢什么?
BLOG

AI办公这个垃圾赛道,大厂到底在抢什么?

最近电梯里全是什么Work、什么Buddy的洗脑广告,千问办公、TraeWork、WorkBuddy这帮AI办公工具,正在把国内的三国杀打得头破血流。 但我开篇就要暴论一下:AI办公这个领域的竞争,基本上没有任何意义,这就是一个彻头彻尾的“垃圾赛道”!(至少在中国是) 但既然是垃圾赛道,为什么阿里、腾讯、字节甚至远在硅谷的谷歌,全都要疯狂砸钱抢地盘?难道真的是人性的沉沦? 如果你只把它当成一个卖给打工人的效率工具,那你连这盘棋的门槛都没摸到。 别装了,你们都是来烧Token的 有一件事情是绝对明确的:只要你把AI拉进办公场景,尤其是工作群聊,你的Token消耗量跟以前相比,绝对是呈指数级爆炸的。 以前AI是单聊,你问一句它答一句。现在AI进了群,它要干嘛?它要读上下文啊!不管它干没干活,群里几百条瞎扯淡的聊天记录、扯皮的会议纪要,它都得每一条嚼碎了咽下去,再吐出交付物。这消耗量比你一个人在那儿交豆包盯钓鱼要大出几十倍甚至上百倍! 大厂的云业务部门看着这疯狂飙升的消耗量,估计做梦都能笑醒:终于有傻子来海量烧Token了! 以前C端

JustSayAI·2026年8月21日
99%的人不配用它!|DeepSeek Harness是一座造Agent的工厂啊!
BLOG

99%的人不配用它!|DeepSeek Harness是一座造Agent的工厂啊!

最近发酵的 DeepSeek Harness(以下简称 DSH),我只能用三个字来形容:大骚货。 开篇暴论一下:很多人把它当成普通的工具更新,这绝对是今年最大的误解。Codex 给你的是一辆配置豪华、插钥匙就能开的量产车,而 DeepSeek Harness 塞给你的是什么?是整整一座造车工厂的生产线! 这种极度的自由,简直把我吓惨了。 它就像游戏里突然解除了所有的系统限制,给你开放了底层代码,但这不仅意味着你能随心所欲,更意味着你随时可能把自己玩死在兼容性的“火葬场”里。 那些天天脑嗨“乐高式模块化拼装”的老板们,你们真的配用这玩意吗? 不是整车,是造车工厂 我最近做了一个很典型的尝试,把我的 DSH 首页直接改成了一个监控看板,专门盯着公司里哪些群聊没人回复,哪个刁民天天已读不回。 发到朋友圈后,老板们全嗨了,纷纷喊着“给我搭一个!我公司好多刁民呐!” 这听起来很爽对吧?但这只是大骚货最表层的玩法。它真正骚的地方在于,它系统性地解决了底层配件的组装逻辑。 如果你把 Codex 看成是原厂整车——特斯拉或者 BBA,从设

JustSayAI·2026年8月21日
拐点!DeepSeek V4 Flash斩杀线逼疯硅谷,Google高层先地震了?其他模型还能活多久?
BLOG

拐点!DeepSeek V4 Flash斩杀线逼疯硅谷,Google高层先地震了?其他模型还能活多久?

当 DeepSeek V4 Flash 带着比同行低 10 倍的价格砸向市场时,我原本以为这只是一场寻常的价格战。但我错了,这根本不是什么商业内卷,而是一道血淋淋的"斩杀线"!在这条线划定的一瞬间,硅谷的巨头们彻底破防了。 这道斩杀线到底有多残暴?你这么理解吧,这就相当于一件原本在美国卖 10 块美金的货,现在被中国企业硬生生干到了 10 块钱人民币!硬是把大模型干出了拼多多的气质。这怎么玩?那些定价高高在上的模型,瞬间全成了智商税。 这就好比现在的中国电车市场。以前你要花四五十万才能买到的 BBA 豪华体验,现在 20 万的国产电车直接给你拉满。结果呢?BBA 销量狂跌,连二手车都快卖不出去了。DeepSeek V4 Flash 就是那个把锚点死死钉在地上的狠角色。这就跟当年吕布辕门射戟一样,我这一箭射在这儿了,斩杀线以下的这帮公司,你们掂量掂量自己,到底还要不要干这事?这才是真正的降维打击!这完全就是把 AI 变成了有医保目录的时代,曾经昂贵的特效药,现在直接走集采就完事了。贵的?谁还买单? 我给你一个更接地气的比喻。当年那帮小老板刚起步的时候,谁开五菱宏

JustSayAI·2026年8月6日