本期讲什么
特斯拉的机器人都开始跳舞了,离它们进厂拧螺丝、进家做饭只剩一步之遥——是时候认真想一个问题:当AI越来越聪明,甚至即将超越人类,我们还有办法”管住”它吗?本期节目带你看懂当下最前沿的”人机对齐”(AI Alignment)四大思路:从 OpenAI 的”超级对齐”(Superalignment)、Anthropic 的”AI宪法”(Constitutional AI),到给AI做”脑成像”的”机械诠释学”(Mechanistic Interpretability),再到埃隆·马斯克(Elon Musk)那个最离经叛道的 xAI”真理至上”方案。这背后站着的,是被称作”ChatGPT之父”的伊利亚·苏茨克维(Ilya Sutskever)、提出”回形针悖论”的哲学家尼克·波斯特罗姆(Nick Bostrom)等一众关键人物。四种思路一个比一个脑洞大,最后一种甚至像走错了片场……
本期看点:
• 回形针悖论:为什么哪怕AI毫无恶意、只想严格”听话”,也可能把全人类乃至全宇宙拆掉做成回形针?(波斯特罗姆的著名思想实验)
• 思路一|用AI监督AI:OpenAI 的”超级对齐”——培养一个”AI裁判”去看管更聪明的AI,苏茨克维设想的这条”缚神索”真能拴住神吗?
• 思路二|给AI写宪法:Anthropic 把几百条原则内化进 Claude 让它自我约束,但”紧箍咒”管得住孙悟空,管得住如来佛吗?
• 思路三|给AI做”脑成像”:机械诠释学像脑外科医生一样打开AI黑箱,定位”情感神经元””多语种神经元”,找到控制AI行为的”按钮”,堪比X教授的读心加思维控制
Leave a Reply