"Mafia Canada" và Vụ nổ Big Bang của Deep Learning (2004–2015)
Ba người đàn ông bị chế nhạo là "Mafia Canada" giữ mạng nơ-ron sống sót qua mùa đông dài, rồi năm 2012 một sinh viên với hai card đồ họa 500 đô trong phòng ngủ bố mẹ đã thắng ImageNet cách biệt 11 điểm phần trăm — châm ngòi cuộc cách mạng deep learning hiện đại.
"Mafia Canada" và cuộc đổi tên chiến lược cứu cả một lĩnh vực
Đến đầu những năm 2000, "mạng nơ-ron" gần như là một cụm từ bẩn trong khoa học máy tính — giáo sư cảnh báo sinh viên tránh xa vì "bạn sẽ không bao giờ có việc làm". Nhưng ba người từ chối để than hồng chết: Geoffrey Hinton (Đại học Toronto, từ 1987), Yann LeCun (cha đẻ CNN/LeNet 1989), và Yoshua Bengio (Đại học Montreal). Họ tự gọi đùa mình là "âm mưu deep learning"; người ngoài gọi họ là "Mafia Canada". Năm 2004, CIFAR (Canada) rót khoảng 400.000 đô/năm — một phao cứu sinh — khi hầu như không ai ở Mỹ chịu tài trợ nghiên cứu mạng nơ-ron.
Tháng 7/2006, Hinton công bố "A Fast Learning Algorithm for Deep Belief Nets" — và, theo lời chính ông sau này, thực hiện một cuộc đổi tên có chủ ý: gọi nó là "deep learning" thay vì "neural network" để né cụm từ đã bị nguyền rủa trong giới xuất bản và tài trợ. Chiến lược đổi tên đã hiệu quả — đến 2012, "deep learning" là tên của cả một cuộc cách mạng. Năm 2018 cả ba nhận Giải Turing; năm 2024 Hinton nhận Nobel Vật lý.
Trao đổi (0)
Ba thành phần hội tụ tạo nên Vụ nổ Big Bang 2012
Một cuộc cách mạng cần lửa, nhiên liệu, và động cơ — cả ba hội tụ trong vòng sáu năm:
- 1
Tia lửa (thuật toán) — Hinton, 2006: kỹ thuật huấn luyện mạng sâu theo từng lớp, phá vỡ rào cản kỹ thuật cũ.
- 2
Nhiên liệu (dữ liệu) — Fei-Fei Li, ImageNet 2009: 14 triệu ảnh dán nhãn trong hơn 22.000 danh mục, do 49.000 lao động từ 167 quốc gia gán nhãn qua Amazon Mechanical Turk (2008–2010).
- 3
Động cơ (tính toán) — NVIDIA CUDA (2007) + Andrew Ng et al., ICML 2009: huấn luyện một mạng 100 triệu tham số trên 1 GPU trong một ngày thay vì vài tuần trên CPU — tăng tốc khoảng 70 lần.
- 4
Kết hợp — Alex Krizhevsky (với Ilya Sutskever thúc đẩy), 2012: dùng hai GPU GTX 580 (~500 đô/cái) trong phòng ngủ nhà bố mẹ để huấn luyện AlexNet, thắng ILSVRC 2012 với sai số top-5 15,3% so với 26,2% của đối thủ nhì — cách biệt gần 11 điểm phần trăm trong một lĩnh vực mà tiến bộ thường tính bằng phần mười phần trăm mỗi năm.
Trao đổi (0)
AlexNet: thí nghiệm AI quan trọng nhất thế kỷ 21, chạy trong phòng ngủ
Alex Krizhevsky, nghiên cứu sinh trong phòng thí nghiệm của Hinton tại Toronto, bị bạn cùng phòng thí nghiệm Ilya Sutskever thúc đẩy suốt nhiều tháng: "Áp dụng các thủ thuật CUDA của bạn cho ImageNet. Bạn có thể thắng." Krizhevsky mua hai card đồ họa chơi game NVIDIA GTX 580 (3GB bộ nhớ mỗi card, khoảng 500 đô/cái) và lắp trong một máy tính để bàn tại nhà bố mẹ ở Toronto. Mạng có tám lớp học được (năm lớp tích chập, ba lớp kết nối đầy đủ), khoảng 60 triệu tham số và 650.000 nơ-ron, dùng ReLU, dropout, tăng cường dữ liệu — huấn luyện suốt 90 epoch trong 5-6 ngày, mạng phải chia đôi giữa hai GPU vì không card nào đủ bộ nhớ.
Kết quả công bố ngày 30/9/2012, trình bày tại workshop ILSVRC bên lề ECCV Florence (13/10/2012): mạng — đăng ký tên "SuperVision" nhưng cộng đồng gọi ngay là AlexNet — thắng với sai số top-5 15,3%, đội nhì (dùng thị giác máy tính truyền thống) chỉ đạt 26,2%. Yann LeCun, ngồi trong khán giả, đứng dậy tuyên bố đây là "một bước ngoặt không nghi ngờ trong lịch sử thị giác máy tính." Trong vài tuần, mọi phòng thí nghiệm thị giác máy tính nghiêm túc trên Trái Đất bỏ kỹ thuật cũ và chuyển sang deep learning. Ba tháng sau, tại phòng 703 khách sạn Harrah's Lake Tahoe, Hinton — nằm trên sàn vì đau lưng kinh niên — chủ trì một cuộc đấu giá bí mật giữa Google, Microsoft, Baidu, DeepMind cho công ty vỏ ba người DNNresearch Inc.; Google thắng với 44 triệu đô la (tháng 3/2013), định giá gần 15 triệu đô/nhân viên cho một công ty không sản phẩm, không doanh thu.
Nguồn: Chương 9 — "Mafia Canada" / Vụ nổ Big Bang (phần AlexNet & đấu giá DNNresearch)
Trao đổi (0)
Áp dụng khung "tia lửa – nhiên liệu – động cơ" cho một đột phá khác
Chọn một đột phá công nghệ khác mà bạn biết (không nhất thiết AI — có thể là smartphone, mạng xã hội, hoặc một đột phá AI gần đây như ChatGPT). Xác định: đâu là 'tia lửa' (thuật toán/ý tưởng mới), đâu là 'nhiên liệu' (dữ liệu/nội dung sẵn có), đâu là 'động cơ' (hạ tầng/tính toán/phân phối) đã hội tụ để tạo ra nó?
Trao đổi (0)
Cuối tháng 5/đầu tháng 6 năm 2014, tại quán bia Les 3 Brasseurs ở Montreal, nghiên cứu sinh Ian Goodfellow (phòng thí nghiệm của Bengio) nghe bạn bè phàn nàn về việc khó làm mạng nơ-ron tạo ảnh chân thực. Ý tưởng lóe lên: đặt hai mạng nơ-ron đối đầu nhau — một "Generator" cố tạo ảnh giả, một "Discriminator" cố phân biệt giả với ảnh thật. Goodfellow đạp xe về nhà ngay đêm đó và code toàn bộ ý tưởng — nó hoạt động ngay lần đầu tiên. Yann LeCun sau này gọi GAN là "ý tưởng thú vị nhất trong 10 năm qua trong machine learning." Cùng năm đó, word2vec của Google (Mikolov et al.) cho thấy vector("vua") − vector("đàn ông") + vector("phụ nữ") ≈ vector("nữ hoàng") — lần đầu tiên máy tính có một biểu diễn số học của ý nghĩa từ ngữ, hạt giống của mọi mô hình ngôn ngữ hiện đại.
Trao đổi (0)
Đăng nhập ở góc trên để lưu tiến độ đọc.