棋牌人工智能简史:从深蓝到AlphaGo与绝艺
从1997年深蓝战胜卡斯帕罗夫到AlphaGo、绝艺与麻将AI,本文梳理棋牌人工智能三十年的技术路线与对人类棋手的影响。
棋牌一直是人工智能最钟爱的试验场:规则明确、胜负可判、复杂度却足够惊人。过去三十年,AI 在棋牌领域完成了从「算得快」到「学得会」的跃迁,也彻底改变了人类棋手的训练方式。本文按时间线梳理这条技术脉络。
一、深蓝时代:把搜索算到极致(1997)
1997 年 5 月,IBM 的深蓝(Deep Blue) 以 3.5:2.5 战胜国际象棋世界冠军卡斯帕罗夫,成为 AI 史上的标志性事件。
深蓝的技术路线可以概括为暴力搜索 + 人工评估函数:
- 用专用硬件实现极高的每秒搜索局面数;
- 靠 Alpha-Beta 剪枝把搜索树砍到可算的规模;
- 评估函数由人类大师参与调参,写入子力价值、王的安全、兵形结构等经验。
深蓝证明了一件事:在分支因子适中的棋类里,算力加人类知识可以超越顶尖人类。但它的方法无法直接搬到围棋上——围棋每步平均合法着法约 250,搜索空间远超国际象棋。
二、蒙特卡洛树搜索:围棋的第一次突破(2006 起)
2006 年前后,蒙特卡洛树搜索(MCTS) 引入围棋程序,思路从「穷举评估」转向「随机模拟胜率」:不再试图精确判断局面价值,而是从当前局面出发大量随机试下,用胜率统计指导选点。
MCTS 让围棋程序从业余低段跃升至业余高段,但面对职业棋手仍有明显差距——随机模拟的质量成了瓶颈。
三、AlphaGo:深度学习 + 强化学习(2016—2017)
2016 年 3 月,DeepMind 的 AlphaGo 以 4:1 战胜韩国棋手李世石,震动整个围棋界。2017 年 5 月,AlphaGo 在中国乌镇以 3:0 战胜当时世界第一的柯洁。
AlphaGo 的关键创新是把三样东西缝在一起:
- 策略网络:用深度卷积网络预测「人类高手会走哪里」,大幅缩小搜索宽度;
- 价值网络:直接评估局面胜率,替代低质量的随机模拟;
- MCTS:把两个网络的输出组织成实际的着法选择。
2017 年 10 月,AlphaGo Zero 更进一步——完全不使用人类棋谱,仅凭规则自我对弈从零学起,几天内超越所有前代版本。它带来的启示是:人类经验既是加速器,也可能是天花板。
四、国产围棋 AI:绝艺与星阵
中国团队几乎同步跟上。腾讯的绝艺(Fine Art) 在 2017 年 UEC 杯计算机围棋大赛夺冠,随后长期作为职业棋手的训练工具;中科院背景的星阵(Golaxy) 也在职业对局与人机指导中广泛应用。
今天,「AI 胜率曲线」已经成为围棋直播的标准配置,职业棋手的日常训练几乎离不开 AI 复盘。围棋 AI 还改写了不少定式认知——过去被认为「俗手」的点三三、早期肩冲,在 AI 体系下重新获得评价。
五、非完全信息博弈:扑克与麻将
围棋是完全信息博弈,双方看到的信息一致。真正的难题是不完全信息——牌类游戏里你看不到对手的手牌。
- 扑克:2017 年,卡内基梅隆大学的 Libratus 在一对一无限注德州扑克中战胜多位职业选手,核心技术是博弈论均衡求解与实时子博弈重解;
- 麻将:2019 年,微软亚洲研究院的 Suphx 在日本麻将平台「天凤」上达到十段水平,需要处理隐藏牌、随机摸牌与四人博弈;
- 斗地主:2021 年的 DouZero 用深度蒙特卡洛方法在斗地主 AI 排行榜上登顶,验证了在多智能体、动作空间巨大的牌类中强化学习同样可行。
这些成果的共同价值在于:AI 学会了在信息缺失下做概率决策,甚至学会了「诈」——扑克 AI 会主动虚张声势,因为博弈论均衡本身就要求一定比例的虚张。
六、AI 给人类棋手带来了什么
- 训练方式革命。过去靠师徒口传与棋谱背记,现在可以即时得到胜率与最佳变化,学习效率成倍提升;
- 认知边界扩展。AI 打破了很多「常识」,让棋手重新审视既有定式与经验;
- 公平性挑战。线上对局出现 AI 作弊问题,反外挂与行为检测成为平台的必修课;
- 人的价值重新定位。棋牌的魅力从未只是「谁算得准」,还有临场心理、对手研究与竞技仪式感——这些恰恰是 AI 无法替代的部分。
从深蓝到 AlphaGo,再到扑克与麻将 AI,三十年的主线其实很清晰:从人写规则,到机器自己学规则。而对棋牌爱好者来说,最实际的收获是:我们第一次拥有了随时可用、永不疲倦的顶级陪练。