Hai tuần trước, Anthropic và OpenAI gần như đồng loạt tung ra một tính năng có tên gần giống hệt nhau: “Record a Skill” trên Claude Cowork và Codex. Cả hai đều cho phép người dùng ghi lại màn hình, click chuột, gõ phím và giọng nói, sau đó biến toàn bộ quy trình thành một tác vụ tự động có thể tái sử dụng. Đây không phải là một bước đột phá về thuật toán — không có kiến trúc mới, không có cơ chế học sâu chưa từng thấy — mà là một sự kết hợp khéo léo giữa các khả năng đã có: mô hình đa phương thức, nhận diện giọng nói, và sinh mã. Nhưng nếu nhìn dưới góc nhìn của một người làm due diligence blockchain, tôi thấy một câu chuyện thú vị hơn nhiều: cuộc đua này đang phơi bày ranh giới giữa “automation trung tâm” (do một công ty kiểm soát) và “automation phi tập trung” (do cộng đồng và hợp đồng thông minh điều phối). Và blockchain, dù chưa xuất hiện trong bài báo gốc, có thể là mảnh ghép còn thiếu cho một tương lai mà AI Agent không chỉ là công cụ bạn thuê, mà là hạ tầng bạn sở hữu.
Hook: Lời hứa không cần viết code
“Claude ghi lại màn hình, click chuột, gõ phím và giọng nói, sau đó biến bản demo đó thành một Skill có thể dùng lại.” Đọc câu này, tôi nhớ ngay đến những ngày đầu của smart contract — khi người ta hứa rằng “bạn không cần luật sư, chỉ cần kéo thả hợp đồng”. Lời hứa đó, thường kết thúc bằng một địa chỉ ví duy nhất. Và bây giờ, lời hứa mới là: bạn không cần kỹ sư RPA, chỉ cần làm mẫu và để AI bắt chước. Nhưng nếu nhìn vào bản chất kỹ thuật, đây chỉ là một lớp sơn mới phủ lên công nghệ behavior cloning cũ. Claude không hiểu tại sao bạn click nút đó; nó chỉ học được rằng sau một chuỗi pixel và sự kiện bàn phím, kết quả mong đợi sẽ xuất hiện. Sự thiếu hiểu biết về ngữ nghĩa này là điểm yếu chết người khi môi trường thay đổi — một nút “Save” đột nhiên chuyển từ góc phải sang góc trái, và toàn bộ Skill sụp đổ.
Context: Bối cảnh cuộc đua AI Agent
Anthropic và OpenAI đang cạnh tranh trực tiếp trên cùng một mặt trận: biến mô hình ngôn ngữ thành một trợ lý có thể thao tác với giao diện người dùng giống như con người. Codex ra đời trước, nhắm vào lập trình viên với khả năng sinh code trong IDE. Claude Cowork, với tính năng “Record Skill”, nhắm vào nhân viên văn phòng không rành kỹ thuật — những người làm công việc nhập liệu, kế toán, quản lý quy trình. Cả hai đều đặt cược vào một thị trường rộng lớn: tự động hóa quy trình làm việc trên desktop. Nhưng điểm mù chung của cả hai là: dữ liệu và quy trình đều nằm trên server của họ. Mỗi lần bạn ghi lại một Skill, bạn đang gửi toàn bộ hành vi làm việc — mật khẩu hiện trên màn hình (nếu ứng dụng không che), tài liệu nội bộ, giọng nói cuộc họp — lên đám mây của Anthropic hoặc OpenAI. Đây là một vấn đề bảo mật khủng khiếp, nhưng ít người dùng nhận ra. Và đây chính là nơi blockchain có thể bước vào: một lớp xác thực phi tập trung, nơi Skill không phải là file JSON gửi lên server trung tâm, mà là một hợp đồng thông minh chạy trên máy ảo riêng tư (TEE hoặc zkVM), chỉ lộ ra kết quả cuối cùng chứ không phải toàn bộ quy trình.
Core: Mổ xẻ kỹ thuật “Record Skill” dưới lăng kính blockchain
1. Cơ chế học và sao chép hành vi
Kỹ thuật cốt lõi là Behavior Cloning kết hợp với mô hình đa phương thức. Claude ghi lại luồng video màn hình, tín hiệu chuột và bàn phím, cùng âm thanh giọng nói. Sau đó, mô hình đa phương thức mã hóa tất cả thành một vector ngữ cảnh, và sinh ra một chuỗi lệnh có thể thực thi — thường là script Python hoặc PowerShell, kèm theo bộ chọn UI (CSS selector hoặc tọa độ tương đối). Trong blockchain, một quy trình tương tự có thể được thực hiện bằng cách ghi lại các tương tác với dApp: bạn click vào nút “Stake”, nhập số lượng, xác nhận MetaMask. Nếu AI có thể học và tái tạo hành vi đó trên môi trường blockchain, nó có thể tự động hóa các tác vụ DeFi như yield farming, rebalance danh mục, hay chốt lời. Nhưng khác với môi trường desktop, blockchain là bất biến: mỗi giao dịch đều để lại dấu vết. Một Skill ghi lại hành vi giao dịch có thể được kiểm toán bởi bất kỳ ai — đó là một lợi thế về minh bạch.
2. Vấn đề về độ tin cậy (Reliability)
Bài báo chỉ ra rằng Skill có thể thất bại khi giao diện thay đổi. Trong thế giới blockchain, giao diện front-end thường thay đổi (do upgrade, do fork), nhưng hợp đồng thông minh (smart contract) thì cố định. Nếu Skill được xây dựng dựa trên tương tác với ABI (Application Binary Interface) thay vì pixel màn hình, nó sẽ bền vững hơn. Một hướng đi là: thay vì ghi lại màn hình, AI ghi lại các lời gọi hàm và tham số, sau đó tự động tạo ra script dùng ethers.js hoặc web3.py. Điều này đòi hỏi AI phải hiểu được cấu trúc của smart contract — một bài toán khó hơn, nhưng hoàn toàn khả thi với các mô hình ngôn ngữ lớn hiện nay.
3. Khả năng mở rộng và kinh tế học của Skill
Trong mô hình của Anthropic và OpenAI, Skill là tài sản độc quyền, chỉ chạy được trên nền tảng của họ. Trong blockchain, Skill có thể là một tài sản kỹ thuật số (NFT) — bạn tạo ra một Skill, đăng ký bản quyền trên chuỗi, và cho người khác thuê hoặc bán thông qua hợp đồng thông minh. Mỗi lần Skill được thực thi, một phần phí sẽ trả cho người tạo, tương tự như mô hình royalty trong NFT. Điều này tạo ra một thị trường phi tập trung cho các agent tự động: ai cũng có thể tạo và kiếm tiền từ các quy trình tự động của mình, mà không cần sự cho phép của bất kỳ công ty nào.
4. Quyền riêng tư và dữ liệu
Như phân tích ở phần Context, rủi ro lớn nhất của “Record Skill” là dữ liệu nhạy cảm bị gửi lên server trung tâm. Blockchain kết hợp với tính toán bảo mật (TEE, zk-SNARKs) có thể giải quyết: Skill được thực thi trong một môi trường cách ly (enclave), chỉ kết quả đầu ra được ghi lại trên chuỗi, còn dữ liệu đầu vào (màn hình, giọng nói) không bao giờ rời khỏi máy người dùng hoặc được mã hóa. Các giao thức như Phala Network (TEE) hay Aleo (zk) đang xây dựng hạ tầng cho điều này, nhưng chưa có tích hợp trực tiếp với AI agent.
Contrarian: Phần phe bò đúng
Tuy nhiên, tôi phải thừa nhận rằng cách tiếp cận tập trung của Anthropic/OpenAI có lợi thế về tốc độ và trải nghiệm người dùng. Blockchain đi kèm với độ trễ, phí gas, và độ phức tạp khi quản lý khóa. Một nhân viên kế toán chỉ muốn copy một thao tác Excel sang hệ thống kế toán, không muốn phải deal với wallet và hợp đồng thông minh. Trong ngắn hạn (0-12 tháng), mô hình tập trung sẽ thắng về số lượng người dùng. Nhưng trong dài hạn, khi các công ty lớn (ngân hàng, bảo hiểm, chính phủ) bắt đầu yêu cầu kiểm toán, tuân thủ, và quyền sở hữu dữ liệu, nhu cầu về một lớp phi tập trung sẽ tăng vọt. Lớp sơn ICO vẫn còn mùi gas, chỉ là lớp sơn mới.
Takeaway: Kêu gọi trách nhiệm
Câu hỏi không phải là “AI Agent có thay thế con người không?”, mà là “Ai sở hữu các agent đó?” Nếu bạn ghi lại toàn bộ quy trình làm việc của mình và giao nó cho Anthropic, bạn đang xây nhà trên đất thuê. Nếu bạn tạo Skill dưới dạng hợp đồng thông minh, bạn là chủ nhân thực sự. Trong một thế giới mà automation là tài sản quý giá nhất, việc chọn nền tảng để xây dựng nó là quyết định sống còn. Đừng để lời hứa tiện lợi đánh lừa bạn.