Thư viện số

Năm của các agents — khi AI bắt đầu hành động (2024)

Sau "Cú nháy" 5 ngày lật đổ rồi phục hồi CEO OpenAI, năm 2024 chứng kiến AI chuyển từ trả lời câu hỏi sang tự hành động — một kỹ sư phần mềm AI, một mô hình biết "suy nghĩ" trước khi trả lời, một AI điều khiển máy tính như con người — trong khi hai giải Nobel vinh danh AI và một cái chết gây tranh cãi phơi bày cái giá con người của cuộc đua.

Từ "trả lời câu hỏi" sang "hành động trong thế giới"

Năm 2024 mở đầu bằng dư chấn của "Cú nháy" (the Blip) — 5 ngày tháng 11/2023 khi hội đồng quản trị OpenAI sa thải rồi phải phục hồi CEO Sam Altman sau khi gần như toàn bộ 800 nhân viên đe dọa nghỉ việc — sự kiện phơi bày rằng không ai thực sự kiểm soát công ty AI mạnh nhất thế giới. Từ nền đó, 2024 trở thành năm mà thuật ngữ "agentic AI" thống trị: AI không chỉ trả lời câu hỏi mà tự thực hiện chuỗi hành động nhiều bước — viết code, sửa lỗi, chạy chương trình, điều khiển máy tính — với rất ít giám sát con người.

Cuối năm 2024, ngành đã chứng kiến: 6 phiên bản frontier model mới (GPT-4o, gia đình Claude 3, Claude 3.5 Sonnet, Gemini 1.5, LLaMA 3/3.1, o1/o3), mô hình text-to-video đầu tiên ở quy mô lớn (Sora), khả năng Computer Use đầu tiên, hai giải Nobel cho AI trong cùng một tuần (Vật lý: Hopfield + Hinton; Hóa học: Hassabis + Jumper + Baker cho AlphaFold), và một làn sóng rời bỏ của các nhà nghiên cứu an toàn khỏi OpenAI.

Trao đổi (0)

    Khung kiến thức

    Bốn cột mốc dựng nên "năm của agents"

    Trong vòng chưa đầy 9 tháng, bốn đột phá liên tiếp định hình khái niệm agentic AI:

    1. 1

      12/3/2024 — Devin (Cognition Labs): tự nhận là "kỹ sư phần mềm AI đầu tiên thế giới", tự mở terminal, duyệt Stack Overflow, viết mã, sửa lỗi, chạy test, và triển khai ứng dụng — không cần con người can thiệp từng bước.

    2. 2

      13/5/2024 — GPT-4o: mô hình đầu tiên huấn luyện đồng thời trên văn bản, hình ảnh, âm thanh trong một mạng nơ-ron duy nhất; demo giọng nói cảm xúc khiến Sam Altman tweet một từ "her" (ám chỉ bộ phim về AI biết yêu) — và miễn phí cho tất cả mọi người.

    3. 3

      22/10/2024 — Anthropic Computer Use: Claude 3.5 Sonnet có thể chụp màn hình, di chuyển chuột ảo, nhấp nút, gõ văn bản trên máy tính thật — lần đầu một mô hình tiên tiến vận hành máy tính như con người, sau 90 năm quan hệ ngược lại.

    4. 4

      12/9/2024 → 20/12/2024 — o1 rồi o3 (OpenAI): mô hình "suy nghĩ" bằng chuỗi lý luận nội bộ dài trước khi trả lời, thay vì chỉ dựa vào mô hình lớn hơn. Kết quả: điểm AIME 2024 nhảy từ 13% (GPT-4o) lên 83% (o1); điểm ARC-AGI nhảy từ 32% lên 87,5% (o3, đánh bại trung bình con người).

    Trao đổi (0)

      Case study

      Devin: "kỹ sư phần mềm AI đầu tiên thế giới" và 30 triệu lượt xem

      Chỉ hơn một tuần sau khi Claude 3 ra mắt (4/3/2024), một startup nhỏ mới thành lập bốn tháng trước đó — Cognition Labs, sáng lập bởi Scott Wu, Steven Hao, và Walden Yan — ra mắt Devin bằng một video viral. Trong demo, Devin tự mở một thiết bị đầu cuối, duyệt Stack Overflow tìm giải pháp, viết mã, tìm và sửa lỗi, chạy các bài kiểm tra, rồi triển khai ứng dụng — toàn bộ chuỗi việc một kỹ sư phần mềm thật sự làm, không cần con người can thiệp từng bước. Nó đạt 13,86% trên SWE-bench (giải các vấn đề GitHub thực tế), so với trạng thái tiên tiến trước đó chỉ 1,96% — một bước nhảy gấp bảy lần.

      Video demo thu hơn 30 triệu lượt xem trên X. Cognition Labs được định giá 350 triệu đô la trên chỉ 21 triệu đô la tài trợ đã huy động. "Agentic AI" trở thành từ khóa của năm — không phải vì Devin hoàn hảo (nhiều nhà phê bình sau đó chỉ ra demo có phần được dàn dựng chọn lọc), mà vì nó chứng minh một hướng đi khả thi: AI có thể tự lập kế hoạch và thực hiện một chuỗi hành động dài, không chỉ trả lời một câu hỏi đơn lẻ.

      Nguồn: Chương 13 — Năm của các agents (phần Devin / Cognition Labs)

      Trao đổi (0)

        Bài tập thực hành

        Ranh giới tin cậy: bạn sẽ giao gì cho một AI agentic?

        Với Anthropic Computer Use, câu hỏi "ai đang điều khiển ai?" được đặt ra khi AI bắt đầu tự nhấp chuột, gõ phím trên máy tính thật. Hãy liệt kê 3 việc trên máy tính của bạn mà bạn SẼ giao cho một AI agentic tự làm không cần giám sát từng bước (ví dụ: sắp xếp lại thư mục ảnh), và 3 việc bạn TUYỆT ĐỐI KHÔNG giao (ví dụ: chuyển tiền ngân hàng). Với mỗi việc, giải thích ngắn gọn tiêu chí bạn dùng để phân loại.

        Trao đổi (0)

          Lưu ý · Cái giá con người phía sau cuộc đua: bi kịch của Suchir Balaji

          Tháng 11/2024, ngay trước cú sốc DeepSeek, một cựu nhà nghiên cứu OpenAI 26 tuổi tên Suchir Balaji — người đã công khai cáo buộc OpenAI vi phạm luật bản quyền Hoa Kỳ trong một cuộc phỏng vấn với New York Times ngày 23/10/2024 — được tìm thấy đã qua đời tại căn hộ của mình ở San Francisco vào ngày 26/11/2024. Cảnh sát kết luận đó là một vụ tự sát; cha mẹ ông công khai tranh cãi kết luận này và đã nộp đơn kiện. Sự việc trở thành một điểm bùng nổ trong cuộc chiến bản quyền rộng hơn quanh dữ liệu huấn luyện AI. Đây là lời nhắc rằng đằng sau các con số benchmark và định giá tỷ đô, ngành công nghiệp AI đang phát triển nhanh đến mức những thiệt hại về uy tín, sự nghiệp, và đôi khi cả sinh mạng con người có thể chồng chất nhanh hơn các cuộc trò chuyện đạo đức đang cố gắng theo kịp.

          Trao đổi (0)

            Đăng nhập ở góc trên để lưu tiến độ đọc.