AI bot trading: học tăng cường và agent LLM làm được gì thật
AI không biến một chiến lược thua thành thắng. Điều nó làm được là xử lý những bài toán mà quy tắc cứng không viết nổi — nhưng đổi lại bạn mất khả năng biết vì sao bot vừa vào lệnh.
Cụm từ "AI bot trading" bị dùng cho quá nhiều thứ khác nhau, từ một mô hình hồi quy đơn giản tới lời quảng cáo bán khoá học. Bài này phân biệt rõ những gì thực sự làm được, những gì chỉ là tiếp thị, và cái giá phải trả khi đưa AI vào hệ thống giao dịch.
AI khác bot quy tắc ở đâu
Một bot quy tắc làm chính xác điều bạn viết. Nếu giá vượt trung bình 20 phiên thì mua. Bạn đọc mã là biết nó sẽ làm gì trong mọi tình huống.
Bot dùng học máy không được viết quy tắc. Nó được đưa dữ liệu và mục tiêu, rồi tự tìm ra mối quan hệ. Kết quả là một hàm số có thể có hàng nghìn tham số, và không ai — kể cả người huấn luyện — nói chính xác được vì sao nó ra quyết định đó.
Đánh đổi rất rõ ràng. Bạn được khả năng xử lý những quan hệ phi tuyến giữa nhiều biến số mà con người không viết nổi thành quy tắc. Bạn mất khả năng gỡ lỗi. Khi bot lỗ ba tuần liên tiếp, với bot quy tắc bạn đọc mã và biết chuyện gì xảy ra; với mô hình học máy bạn chỉ có thể đoán.
Với người làm một mình, khả năng gỡ lỗi không phải thứ xa xỉ. Đó là lý do nên bắt đầu từ quy tắc rõ ràng và chỉ đưa AI vào đúng chỗ nó thực sự cần thiết.
Học tăng cường: hợp với bài toán nào
Học tăng cường huấn luyện một tác nhân bằng cách cho nó hành động trong môi trường và nhận thưởng hoặc phạt. Nghe rất hợp với giao dịch: hành động là mua bán, thưởng là lợi nhuận.
Thực tế phức tạp hơn nhiều, vì ba lý do.
Thiết kế hàm thưởng cực khó. Nếu thưởng theo lợi nhuận từng bước, mô hình học được rằng nhận rủi ro lớn cho kết quả tốt — cho tới lần thua đầu tiên. Hàm thưởng phải phạt cả biến động và mức sụt giảm, và cân bằng giữa chúng là nghệ thuật hơn khoa học.
Môi trường mô phỏng không giống thật. Tác nhân học trong môi trường backtest nơi lệnh luôn khớp đẹp. Thị trường thật có trượt giá, có độ trễ, có lệnh bị từ chối. Mô hình giỏi trong mô phỏng thường tệ khi ra thật.
Dữ liệu tài chính không dừng. Quy luật thay đổi theo thời gian. Tác nhân học từ giai đoạn thị trường tăng sẽ hành xử sai khi chế độ thị trường đổi.
Nơi học tăng cường tỏ ra hữu ích nhất không phải dự đoán hướng giá, mà là thực thi: chia nhỏ một lệnh lớn thế nào để giảm ảnh hưởng lên giá, hoặc điều chỉnh khối lượng theo trạng thái thị trường. Đó là những bài toán có phản hồi rõ ràng và ít phụ thuộc vào việc đoán tương lai.
Agent LLM: làm được và không làm được
Mô hình ngôn ngữ lớn đã thay đổi một số việc trong quy trình nghiên cứu, nhưng không theo cách mà quảng cáo hay nói.
Làm được tốt: đọc và phân loại văn bản. Đọc báo cáo tài chính rồi trích ra các chỉ số. Đọc tin tức và đánh giá sắc thái tích cực hay tiêu cực với một doanh nghiệp. Tóm tắt biên bản họp ngân hàng trung ương. Đây là những việc trước đây cần người ngồi đọc, và làm tự động được là bước tiến thật.
Làm được ở mức hỗ trợ: viết mã cho chiến lược, dò lỗi trong backtest, sinh ý tưởng để kiểm định.
Không làm được: ra quyết định giao dịch. Mô hình ngôn ngữ không có khái niệm về xác suất thua lỗ, không biết nó đang chắc chắn tới đâu, và có thể tạo ra một lập luận nghe rất thuyết phục cho kết luận hoàn toàn sai. Giao quyền đặt lệnh cho nó là giao tiền cho một thứ tự tin đều nhau bất kể đúng hay sai.
Ranh giới hợp lý: LLM xử lý văn bản thành số liệu, số liệu đó đi vào một hệ thống có quy tắc rõ ràng, và quy tắc đó quyết định lệnh.
Nhận diện chế độ thị trường
Đây là ứng dụng mà học máy tỏ ra hợp lý nhất với người làm một mình.
Vấn đề thực tế: một chiến lược bám xu hướng kiếm tiền khi thị trường có xu hướng và mất tiền đều đặn khi thị trường đi ngang. Nếu biết được lúc nào thị trường đang ở chế độ nào, bạn có thể tắt bật chiến lược tương ứng.
Đây là bài toán phân loại, hợp với học máy hơn bài toán dự đoán giá. Nó cũng có ưu điểm lớn: kể cả khi mô hình sai, hậu quả chỉ là bỏ lỡ cơ hội hoặc chịu thêm ít lỗ, chứ không phải một lệnh sai hướng.
Cái giá của việc đưa AI vào
Bốn khoản chi phí mà người mới thường không tính tới.
Chi phí huấn luyện lại. Mô hình phải được huấn luyện lại định kỳ khi thị trường đổi. Điều đó cần quy trình, cần dữ liệu sạch liên tục, và cần cách quyết định khi nào thay mô hình cũ bằng mô hình mới.
Chi phí phát hiện trôi. Bạn cần biết khi nào mô hình bắt đầu hoạt động kém đi, trước khi nó gây thiệt hại lớn. Điều này đòi hỏi giám sát riêng, không chỉ nhìn lợi nhuận.
Chi phí hạ tầng. Huấn luyện cần máy, lưu dữ liệu cần chỗ, chạy suy luận thời gian thực cần độ trễ thấp.
Chi phí không hiểu được hệ thống của mình. Khoản này không đo bằng tiền nhưng đắt nhất. Khi bot lỗ và bạn không biết vì sao, bạn không có cơ sở nào để quyết định nên kiên nhẫn chờ hay nên tắt.
Làm sao biết mô hình đã hỏng
Với bot quy tắc, bạn biết nó hỏng khi nó làm sai điều bạn viết. Với mô hình học máy, không có "điều bạn viết" để đối chiếu — nên cần cơ chế giám sát riêng.
Ba tín hiệu đáng theo dõi, tách biệt với lợi nhuận.
Phân phối đầu vào đổi. So sánh phân phối các biến đầu vào hiện tại với phân phối lúc huấn luyện. Khi chúng lệch nhau đáng kể, mô hình đang được hỏi về những tình huống nó chưa từng thấy — và câu trả lời của nó không đáng tin nữa.
Phân phối đầu ra đổi. Mô hình trước đây cho tín hiệu mua khoảng một phần ba số phiên, giờ cho bảy mươi phần trăm. Chưa cần biết đúng sai, riêng sự thay đổi này đã đáng dừng lại xem xét.
Độ chắc chắn giảm. Nếu mô hình trả về xác suất, hãy theo dõi mức xác suất trung bình của các dự đoán. Khi nó dạt về gần ngưỡng lưỡng lự, mô hình đang mất khả năng phân biệt.
Ba chỉ số này phát hiện vấn đề sớm hơn nhiều so với việc chờ đường vốn đi xuống — lúc đó tiền đã mất rồi.
Thứ tự hợp lý
Với người làm một mình, con đường ít rủi ro nhất đi theo thứ tự: xây một hệ thống quy tắc rõ ràng và cho nó chạy thật đủ lâu để hiểu hành vi. Sau đó xác định đúng một chỗ mà quy tắc cứng đang bất lực — thường là nhận diện chế độ thị trường hoặc điều chỉnh khối lượng. Chỉ đưa mô hình học máy vào đúng chỗ đó, giữ nguyên phần còn lại.
Và dù dùng phương pháp gì, nguyên tắc kiểm định không thay đổi — thậm chí còn khắt khe hơn, vì mô hình nhiều tham số có khả năng thuộc lòng dữ liệu quá khứ cao hơn hẳn một quy tắc đơn giản.
Câu hỏi thường gặp
- AI có giỏi hơn bot quy tắc không?
- Không tự động giỏi hơn. AI mạnh ở bài toán nhiều biến số tương tác phi tuyến mà con người khó viết thành quy tắc. Với bài toán đơn giản, một quy tắc rõ ràng thường bền hơn và luôn dễ gỡ lỗi hơn.
- Học tăng cường có thực sự dùng được trong giao dịch không?
- Dùng được, nhưng chủ yếu ở bài toán thực thi lệnh và điều chỉnh khối lượng hơn là dự đoán hướng giá. Khó khăn lớn nhất là thiết kế hàm thưởng: thưởng theo lợi nhuận ngắn hạn sẽ dạy mô hình nhận rủi ro quá mức.
- Dùng LLM để đọc tin rồi giao dịch có khả thi không?
- Khả thi ở mức trích xuất và phân loại thông tin từ văn bản, chẳng hạn đánh giá tin tốt hay xấu cho một mã. Không khả thi ở mức giao cho nó quyết định vào lệnh, vì nó không có khái niệm về xác suất thua và có thể tạo ra lập luận nghe hợp lý cho một kết luận sai.
- Cần bao nhiêu dữ liệu để huấn luyện mô hình giao dịch?
- Nhiều hơn bạn nghĩ, và vấn đề không chỉ là số lượng. Dữ liệu tài chính có tỷ lệ nhiễu trên tín hiệu rất cao và phân phối thay đổi theo thời gian, nên mô hình học được quy luật của năm ngoái chưa chắc còn đúng năm nay.
Đọc tiếp
- Phân tích kỹ thuật & price actionPrice action: đọc hành vi giá mà không cần chỉ báo
- Phái sinh VN30F1MPhái sinh VN30F1M là gì: hướng dẫn từ đầu cho người mới
- Quản trị vốn, rủi ro & tâm lýKhối lượng vị thế và giới hạn thua lỗ: phần quyết định bạn sống sót
- Bot trading từ A đến ZBot trading là gì và cách xây con bot đầu tiên