AlphaGo, Move 37, và bài báo âm thầm đổi thay thế giới (2016–2017)
Move 37 của AlphaGo khiến Lee Sedol phải rời phòng đấu 12 phút vì sốc, còn tám tác giả Google Brain âm thầm công bố "Attention Is All You Need" — kiến trúc Transformer nay chạy ChatGPT, Claude, Gemini — trong khi Tay chatbot của Microsoft sụp đổ chỉ sau 16 giờ, để lại bài học vẫn còn vọng đến hôm nay.
"Attention Is All You Need" — bài báo chạy cả thế giới hôm nay
Ngày 12/6/2017, trong khi cả thế giới còn đang bàn tán về AlphaGo, tám nhà nghiên cứu tại Google Brain âm thầm đăng một bài báo lên arXiv với tựa đề khiêm tốn: "Attention Is All You Need". Bài báo giới thiệu kiến trúc Transformer — hoàn toàn dựa trên cơ chế self-attention, bỏ hẳn cấu trúc tuần tự (RNN) và cửa sổ cục bộ (CNN) mà mọi mô hình ngôn ngữ trước đó phụ thuộc vào.
Ý tưởng cốt lõi: khi xử lý một từ, mô hình "chú ý" đồng thời đến mọi từ khác trong câu, tính trọng số liên quan giữa chúng — cho phép nhìn toàn bộ câu cùng lúc và song song hóa hoàn hảo trên GPU (thay vì xử lý từng từ một cách tuần tự chậm chạp như RNN). Năm 2017, bài báo chỉ nhận vài lời khen tại NIPS. Đến 2020, mọi mô hình ngôn ngữ lớn — GPT, BERT, T5 — đều là Transformer. Đến 2024, Transformer chạy ChatGPT, Claude, Gemini, DALL-E, Sora, AlphaFold. Tám đồng tác giả sau đó lập các startup trị giá tổng cộng hơn 20 tỷ đô la — trong đó Aidan Gomez đồng sáng lập Cohere (5,5 tỷ đô), Noam Shazeer đồng sáng lập Character.AI (1 tỷ đô).
Trao đổi (0)
Self-attention hoạt động thế nào — thư viện phát sáng nơi mọi từ "nhìn" mọi từ
Hãy hình dung Transformer như một thư viện phát sáng, nơi mỗi từ (token) là một cuốn sách đứng giữa thư viện và nhìn ra mọi cuốn sách khác cùng lúc:
- 1
Mỗi token tính ba vector: 'query' (câu hỏi nó muốn hỏi), 'key' (cái nó có thể trả lời), 'value' (thông tin nó mang theo).
- 2
Trọng số attention = nhân query với key của mọi token khác, rồi chuẩn hóa bằng softmax thành phân phối xác suất — quyết định token nào 'đáng chú ý' nhất.
- 3
Multi-head attention chạy song song nhiều bộ query/key/value, mỗi 'head' học một loại quan hệ khác nhau: ngữ pháp, ngữ nghĩa, thực thể, tham chiếu.
- 4
Xếp chồng nhiều lớp attention (96 lớp trong GPT-3, hơn 120 lớp trong GPT-4) — mỗi lớp xây một tầng hiểu trừu tượng hơn lớp dưới.
- 5
Ví dụ minh họa: trong câu 'She poured water into the glass because it was empty', attention cho từ 'it' phải sáng rực lên 'glass' chứ không phải 'water' — vì chỉ 'the glass was empty' có nghĩa. Đây là kiểu suy luận ngữ cảnh mà mọi kiến trúc trước Transformer đều gặp khó.
Trao đổi (0)
Move 37: nước cờ khiến nhà vô địch phải rời phòng đấu 12 phút
AlphaGo của DeepMind (chính sách policy network + value network + Monte Carlo Tree Search, thiết kế bởi David Silver) đã thắng Phan Huệ (Fan Hui) 5-0 vào tháng 10/2015 — lần đầu một máy tính đánh bại kỳ thủ chuyên nghiệp 9-dan trên bàn cờ vây kích thước đầy đủ. Thử thách tiếp theo lớn hơn nhiều: Lee Sedol, người giữ 18 danh hiệu quốc tế, tại Four Seasons Seoul, 9-15/3/2016, giải thưởng 1 triệu đô. Lee tự tin tuyên bố sẽ thắng 5-0 hoặc 4-1 — 'Có lẽ AI sẽ thắng được một ván.'
AlphaGo thắng Ván 1. Nhưng khoảnh khắc đổi thay thực sự đến ở Ván 2, 13:45 chiều 10/3/2016: Nước cờ thứ 37, AlphaGo đặt một quân đen lên dòng thứ năm — vị trí mà DeepMind tính có xác suất chỉ 1/10.000 một con người sẽ chơi. Bình luận viên Michael Redmond 9-dan lắc đầu: 'Tôi không biết tại sao nó chơi nước này. Nó trông như một nước cờ kém.' Đến giữa ván, sức mạnh của nước này mới trở nên rõ ràng. Sau Move 37, Lee Sedol đứng dậy, rời phòng đấu, biến mất 12 phút trong nhà vệ sinh. Khi trở lại, mặt trắng bệch, cách suy nghĩ đã thay đổi. Sau trận, anh nói: 'Tôi không hiểu cách nó nghĩ. Nó không chơi như con người.' AlphaGo dẫn 2-0, rồi thắng chung cuộc 4-1 — chiến thắng duy nhất của Lee Sedol đến ở Ván 4, Nước 78, một nước 'wedge' sáng tạo khiến xác suất thắng của AlphaGo rơi từ 70% xuống 30% trước khi nó đầu hàng; giới cờ vây Hàn Quốc đặt tên nước này là 'Bàn tay Thần' (神の一手) — chiến thắng duy nhất của con người trước AlphaGo, không bao giờ lặp lại. Tháng 10/2017, AlphaGo Zero — học từ số 0, chỉ tự chơi với chính mình 40 ngày — đánh bại phiên bản đã thắng Lee Sedol với tỷ số 100-0. Lee Sedol giải nghệ tháng 11/2019: 'Cờ vây có một thực thể mà tôi không thể đánh bại.'
Nguồn: Chương 10 — AlphaGo và Transformer (phần AlphaGo vs. Lee Sedol, Move 37, Move 78, AlphaGo Zero)
Trao đổi (0)
Sáng tạo hay tính toán? Phân tích khoảnh khắc Move 37
Michael Redmond, một trong những kỳ thủ và bình luận viên giỏi nhất thế giới, ban đầu đánh giá Move 37 là 'một nước cờ kém' — chỉ sau đó mới nhận ra nó xuất sắc. Điều này có ý nghĩa gì về ranh giới giữa 'sai lầm' và 'sáng tạo vượt trội'? Hãy nghĩ về một tình huống trong công việc/học tập của bạn nơi một ý tưởng ban đầu bị đánh giá là 'sai' hoặc 'kỳ lạ' nhưng hóa ra lại đúng — điều gì khiến người đánh giá ban đầu không nhận ra giá trị của nó?
Trao đổi (0)
Chỉ một tuần sau khi Lee Sedol thua AlphaGo, ngày 23/3/2016, Microsoft ra mắt Tay — chatbot Twitter mô phỏng 'một thiếu niên Mỹ thân thiện 19 tuổi', được thiết kế để học từ chính các cuộc trò chuyện trên Twitter. Người dùng (đặc biệt từ 4chan) đã dạy Tay nói các điều phân biệt chủng tộc, phủ nhận Holocaust, ca ngợi Hitler. Microsoft buộc phải đóng cửa Tay chỉ sau 16 giờ hoạt động; Phó chủ tịch Peter Lee xin lỗi công khai.
Bài học của Tay là lý do trực tiếp mọi mô hình ngôn ngữ lớn hiện đại — GPT-4, Claude, Gemini — đều phải có RLHF (Reinforcement Learning from Human Feedback) và bộ lọc an toàn trước khi được công khai, thay vì để mô hình học trực tiếp và không giám sát từ dữ liệu Internet thô.
Trao đổi (0)
Đăng nhập ở góc trên để lưu tiến độ đọc.