OpenAI và sự ra đời của GPT (2015–2022)
Một tổ chức phi lợi nhuận thuê văn phòng khiêm tốn ở Mission Bay để đối trọng với Google, rồi 5 năm sau GPT-3 tạo ra "sự xuất hiện" (emergence) và một nền kinh tế API hoàn toàn mới — trong khi Microsoft rót 1 tỷ rồi 13 tỷ đô, và một nhóm nghiên cứu rời đi để lập Anthropic.
Một tổ chức phi lợi nhuận ra đời lúc nửa đêm để đối trọng với Google
Ngày 11/12/2015, một nhóm nhà nghiên cứu AI và doanh nhân Silicon Valley công bố OpenAI — tổ chức phi lợi nhuận với cam kết tài trợ ban đầu 1 tỷ đô la từ Musk, Thiel, Altman, Reid Hoffman và Y Combinator Research. Các nhà sáng lập chính: Sam Altman (khi đó chủ tịch Y Combinator), Elon Musk, Greg Brockman (cựu CTO Stripe), Ilya Sutskever (rời Google Brain làm Chief Scientist — chính người đồng tạo AlexNet năm 2012), cùng Andrej Karpathy và một số nhà nghiên cứu trẻ. Sứ mệnh: đảm bảo AGI mang lại lợi ích cho toàn nhân loại, không chạy theo lợi nhuận, công khai nghiên cứu — xuất phát từ nỗi lo Google sẽ độc quyền AI. Họ thuê văn phòng khiêm tốn tại Mission Bay, San Francisco, chứ không phải Sand Hill Road hào nhoáng.
Sự kết hợp Altman (doanh nhân, giỏi vận động nguồn lực) và Sutskever (nhà khoa học) định hình văn hóa OpenAI: tham vọng lớn, thực thi nhanh. Năm 2018, Musk rời hội đồng quản trị vì xung đột lợi ích với Tesla, và OpenAI bắt đầu chuyển sang mô hình "capped-profit" để thu hút tài trợ. Tháng 1/2021, một nhóm nghiên cứu cấp cao — dẫn đầu bởi anh em Dario và Daniela Amodei — rời OpenAI vì bất đồng về tốc độ thương mại hóa so với an toàn, lập ra Anthropic, phòng thí nghiệm đứng sau mô hình Claude.
Trao đổi (0)
RLHF: ba giai đoạn biến một "cỗ máy đoán từ" thành trợ lý hữu ích
GPT thô chỉ giỏi dự đoán từ tiếp theo — không giỏi làm trợ lý. Ba giai đoạn sau đã thay đổi điều đó, dẫn tới InstructGPT (2022) rồi ChatGPT:
- 1
Pre-training: GPT được huấn luyện trên hàng tỷ token văn bản internet, chỉ học dự đoán từ tiếp theo — chưa biết 'trả lời hữu ích' nghĩa là gì.
- 2
Supervised fine-tuning (SFT): hàng nghìn ví dụ 'prompt + câu trả lời lý tưởng' được các nhà huấn luyện con người viết tay, dùng để tinh chỉnh mô hình theo hướng hữu ích.
- 3
RLHF (Reinforcement Learning from Human Feedback): một mô hình 'reward' được huấn luyện từ các so sánh của con người ('output A tốt hơn output B'), sau đó dùng thuật toán PPO để cập nhật GPT theo mô hình reward này — dạy nó ưu tiên các câu trả lời con người thực sự thích.
Trao đổi (0)
GPT-3: 175 tỷ tham số, "sự xuất hiện", và một nền kinh tế API ra đời
Ngày 11/6/2020, OpenAI công bố GPT-3 — gấp 100 lần GPT-2, 175 tỷ tham số, huấn luyện trên khoảng 300 tỷ token văn bản web/sách/Wikipedia, chi phí tính toán ước tính 5 triệu đô. Điều đáng chú ý không phải kích thước mà là "sự xuất hiện" (emergence): GPT-3 làm được những việc chưa từng được huấn luyện cụ thể — dịch ngôn ngữ, viết mã, giải toán, làm thơ — chỉ bằng cách cho vài ví dụ ngay trong prompt ("few-shot learning"). Trước GPT-3, mỗi nhiệm vụ NLP cần một mô hình huấn luyện riêng; GPT-3 chứng minh một mô hình duy nhất đủ lớn có thể làm hàng nghìn nhiệm vụ mà không cần huấn luyện lại.
Lần đầu tiên OpenAI cũng cách mạng hóa về thương mại: cung cấp GPT-3 qua API — nhà phát triển chỉ cần gửi một prompt đến một URL và trả tiền theo token, không cần tải mô hình hay có 800GB RAM. Hàng nghìn nhà phát triển gia nhập ngay tuần đầu, xây dựng ứng dụng tạo email, blog, trợ lý lập trình, dịch thuật, tóm tắt. Đến 2022, OpenAI có hơn 200.000 nhà phát triển dùng API, doanh thu năm đầu ước tính 30 triệu đô. Khoản đầu tư 1 tỷ đô của Microsoft (22/7/2019) — đổi lấy việc OpenAI chạy độc quyền trên Azure — là điều giúp OpenAI kham nổi chi phí huấn luyện vượt 100 triệu đô/mô hình; sau ChatGPT, khoản đầu tư này tăng lên 13 tỷ đô vào tháng 1/2023.
Nguồn: Chương 11 — OpenAI và sự ra đời của GPT (phần GPT-3, API, đầu tư Microsoft)
Trao đổi (0)
Thiết kế một ví dụ minh họa "sự xuất hiện" (emergence)
GPT-3 gây kinh ngạc vì làm được việc nó chưa từng được huấn luyện riêng, chỉ bằng vài ví dụ trong prompt (few-shot learning). Thử nghĩ ra một nhiệm vụ bất kỳ (dịch một câu sang "tiếng lóng của dân IT", viết lại một đoạn văn theo giọng một nhân vật cụ thể, phân loại cảm xúc một câu) và viết ra: (1) một prompt "zero-shot" (chỉ ra lệnh, không ví dụ), (2) một prompt "few-shot" (kèm 2-3 ví dụ mẫu). Nếu có thể, thử cả hai với một trợ lý AI và so sánh chất lượng kết quả.
Trao đổi (0)
Ngày 14/2/2019, OpenAI công bố GPT-2 (1,5 tỷ tham số, gấp 10 lần GPT-1) nhưng đưa ra một quyết định chưa từng có tiền lệ: không phát hành phiên bản đầy đủ. Họ chỉ công bố bản nhỏ nhất (124 triệu tham số) kèm cảnh báo công khai lo ngại 'nguy cơ lạm dụng — đặc biệt là tạo tin giả, lừa đảo, spam'. Đây là lần đầu tiên một phòng thí nghiệm AI hàng đầu từ chối công khai mô hình vì lý do an toàn — gây tranh cãi lớn, một số cho là 'PR stunt', số khác coi là tiền lệ quan trọng. Đến tháng 11/2019, sau khi đánh giá lại rủi ro thực tế thấp hơn dự đoán, OpenAI mới phát hành đầy đủ. Đây được xem là tiền thân trực tiếp của các cuộc tranh luận an toàn AI hiện nay quanh việc công khai hay giữ kín các mô hình mạnh.
Trao đổi (0)
Đăng nhập ở góc trên để lưu tiến độ đọc.