Reinforcement Learning for Robotics
How rewards turn robot experience into a control policy, why offline data and simulation reduce costly hardware interaction, and where reinforcement learning still breaks on ambiguous success signals.
Cách phần thưởng biến trải nghiệm của robot thành một chính sách điều khiển, vì sao dữ liệu ngoại tuyến và mô phỏng giúp giảm chi phí tương tác phần cứng, và những chỗ học tăng cường vẫn thất bại trước tín hiệu thành công mơ hồ.
Học tăng cường dạy robot cải thiện một chính sách điều khiển dựa trên hậu quả của các hành động của nó, thay vì chỉ sao chép lại các minh họa đã ghi lại. Một tín hiệu phần thưởng cho biết kết quả nào được tính là tiến bộ, trong khi thuật toán học tìm kiếm các hành động làm tăng lợi ích kỳ vọng. Điều này quan trọng trong AI Vật Lý (Physical AI) khi robot phải khắc phục sai lầm hoặc khám phá hành vi mà một tập minh họa cố định không thể hiện. Chính sự tự do đó cũng tạo ra rủi ro thực tế, vì thiết kế phần thưởng, quá trình khám phá và tương tác phần cứng đều có thể sinh ra dữ liệu huấn luyện gây hiểu lầm.
Học tăng cường cho robot là một phương pháp học một chính sách ánh xạ từ quan sát sang hành động sao cho tối đa hóa phần thưởng tích lũy. Khác với Behavior Cloning, vốn học hành động mà một chuyên gia đã thực hiện ở từng trạng thái được ghi lại, học tăng cường có thể gán giá trị cho hành động thông qua hậu quả về sau và có thể cải thiện từ cả những lần thử thất bại lẫn thành công. Phạm vi của nó bao gồm học trực tuyến thông qua tương tác mới, học ngoại tuyến từ các quỹ đạo đã ghi log, và các cách kết hợp bắt đầu bằng minh họa trước khi tinh chỉnh trực tuyến ở mức giới hạn.
Hãy hình dung một cánh tay robot đang học cách lắp một đầu nối vào ổ cắm. Mỗi episode lưu lại khung hình camera, vị trí khớp, trạng thái kẹp, hành động đã ra lệnh, dấu thời gian, trạng thái kết thúc và một phần thưởng. Một chính sách chọn ra một hành động, bộ điều khiển thực thi hành động đó, và môi trường trả về một quan sát mới. Một critic ước lượng lợi ích tương lai gắn với trạng thái và hành động đã quan sát, trong khi actor được cập nhật theo hướng các hành động có lợi ích ước lượng cao hơn. Kết quả thu được là một checkpoint chính sách cùng với dữ liệu replay và logic phần thưởng cần thiết để tái tạo lại quá trình huấn luyện đó.
Một quy trình phổ biến là khởi tạo bộ đệm replay bằng các minh họa, huấn luyện một chính sách ban đầu theo cách ngoại tuyến, sau đó cho phép các lần thử trực tuyến có ràng buộc trên chính robot. Dữ liệu có trước giúp giảm bớt việc khám phá không hiệu quả, trong khi các lần thử trực tuyến bộc lộ những trạng thái mà minh họa đã bỏ sót. RLPD cho thấy một bộ học off-policy có thể kết hợp dữ liệu có trước với trải nghiệm mới bằng một tập nhỏ các thay đổi triển khai, báo cáo mức cải thiện gấp 2,5 lần so với các phương pháp đối chứng trên toàn bộ bộ benchmark của họ vào năm 2023 (Ball et al.).
Thất bại cụ thể xuất hiện khi phần thưởng ở bước kết thúc không thực sự đại diện cho mục tiêu vận hành. Nếu bộ dữ liệu gán nhãn một episode là thành công khi đầu nối vượt qua một ngưỡng độ sâu trong một khung hình, thì một cú nảy tiếp xúc có thể nhận cùng mức phần thưởng như một kết nối đã cắm chặt. Khi đó chính sách học cách kích hoạt điều kiện cảm biến thay vì hoàn tất một thao tác lắp ổn định. Đánh giá ở giai đoạn sau có thể báo cáo sự cải thiện ngay cả khi hành vi được triển khai thực tế thất bại dưới rung động hoặc tải trọng.
Thao tác khéo léo vẫn đang ở giai đoạn nghiên cứu trong các hệ thống benchmark và phòng thí nghiệm được trích dẫn ở đây, trong khi các tác vụ lắp ráp và cầm nắm có ràng buộc đã cho thấy kết quả lặp lại được trên các thiết bị cố định. Học tăng cường hữu ích khi việc khắc phục sai sót, tiếp xúc và các chuỗi hành động dài khiến một mục tiêu giám sát đơn lẻ trở nên không đủ.
Việc cầm nắm bằng robot đã chứng minh khả năng học quy mô lớn trong thế giới thực. QT-Opt được huấn luyện từ hơn 580.000 lần thử cầm nắm và báo cáo tỷ lệ thành công 96 phần trăm trên các vật thể chưa từng thấy trong bối cảnh nghiên cứu của họ vào năm 2018 (Kalashnikov et al.). Kết quả đó thiết lập một mốc benchmark nghiên cứu, chứ không phải một tỷ lệ sản xuất phổ quát.
Các nghiên cứu mô phỏng và nguyên mẫu nghiên cứu cho thấy khả năng vận động và điều khiển toàn thân mạnh mẽ, trong khi mức độ trưởng thành khi triển khai thay đổi tùy theo robot và môi trường vận hành. Các ràng buộc an toàn, giới hạn cơ cấu chấp hành, phạm vi địa hình và việc chuyển giao sang máy cụ thể vẫn là những cửa ải ở cấp hệ thống.
Việc tinh chỉnh chính sách sau khi tiền huấn luyện bằng bắt chước là một hướng nghiên cứu đang hoạt động đối với Vision-Language-Action Models. VLA-RFT báo cáo việc tinh chỉnh bằng học tăng cường trong một bộ mô phỏng thế giới đã học được với ít hơn 400 bước tinh chỉnh trong các thí nghiệm của họ vào năm 2025 (Li et al.). Bài báo không khẳng định rằng cùng ngân sách bước đó có thể áp dụng cho các robot thực tế bất kỳ.
Google DeepMind là một tổ chức nghiên cứu công nghiệp có công việc học robot trải rộng từ thao tác quy mô lớn, các chính sách tổng quát, đến học tăng cường.
Physical Intelligence là một startup phát triển các mô hình nền tảng robot đa dụng. Công trình được công bố của họ tập trung vào các chính sách tiền huấn luyện và việc thích ứng ở giai đoạn sau, chứ không phải một công thức học tăng cường được khẳng định là áp dụng toàn diện cho sản xuất.
Intrinsic phát triển phần mềm cho robot công nghiệp. Công việc nền tảng của họ phản ánh nhu cầu sản xuất thực tế là kết nối hành vi đã học với điều phối, mô phỏng và các cơ chế kiểm soát triển khai có thể lặp lại.
NVIDIA phát triển hạ tầng mô phỏng và học robot thông qua Isaac Lab, hỗ trợ các thí nghiệm học tăng cường ở mức độ trưởng thành dành cho nghiên cứu và kỹ thuật.
D4RL đóng gói các bộ dữ liệu học tăng cường ngoại tuyến và các tác vụ được chuẩn hóa. Các quỹ đạo vận động, điều hướng và thao tác của nó hữu ích để so sánh thuật toán nhưng không thể thay thế dữ liệu từ chính robot mục tiêu.
RL Unplugged cung cấp các bộ dữ liệu benchmark cho học tăng cường ngoại tuyến trên nhiều lĩnh vực, bao gồm các tác vụ điều khiển liên quan đến việc đánh giá chính sách.
DROID chứa các quỹ đạo thao tác robot đa dạng trong thế giới thực. Đây là dữ liệu minh họa chứ không phải một bộ benchmark học tăng cường hoàn chỉnh, vì các định nghĩa phần thưởng và logic reset môi trường vẫn phụ thuộc vào từng tác vụ cụ thể.
RLDS là một định dạng lưu trữ và hệ sinh thái dữ liệu cho các bước theo từng episode, quan sát, hành động và metadata. Lược đồ của nó có thể mang phần thưởng, nhưng một trường hợp lệ không đảm bảo rằng phần thưởng đó mang cùng ý nghĩa giữa các bộ dữ liệu đóng góp.
VLA-RFT: Vision-Language-Action Reinforcement Fine-tuning with Verified Rewards in World Simulators, 2025, nghiên cứu việc tinh chỉnh bằng học tăng cường cho một VLA bên trong một bộ mô phỏng đã học.
SERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learning, 2024, tích hợp một bộ học off-policy, các phương pháp tính phần thưởng, xử lý reset và điều khiển robot. Các thí nghiệm của họ báo cáo việc học được các chính sách thao tác đã chọn trong trung bình 25 đến 50 phút theo các thiết lập của bài báo (Luo et al.).
Efficient Online Reinforcement Learning with Offline Data, 2023, giới thiệu RLPD và phân tích cách các quỹ đạo có trước có thể tăng tốc việc học trực tuyến.
QT-Opt: Scalable Deep Reinforcement Learning for Vision-Based Robotic Manipulation, 2018, minh chứng cho việc học off-policy phân tán dùng cho cầm nắm vòng kín.
Reinforcement Learning in Robotics: A Survey, 2013, hệ thống hóa các thách thức cốt lõi xoay quanh số chiều, trải nghiệm thế giới thực, thiết kế phần thưởng và biểu diễn chính sách.
Học tăng cường cho robot đòi hỏi nhiều hơn chỉ bộ gia tốc học. Toàn bộ hệ thống bao gồm robot, bộ điều khiển động cơ, khóa liên động an toàn, camera hoặc các cảm biến tác vụ khác, ước lượng trạng thái đã hiệu chuẩn, và một cơ chế reset. Việc huấn luyện có thể chạy trên GPU máy trạm hoặc trung tâm dữ liệu, nhưng việc thực thi chính sách phải đáp ứng giới hạn độ trễ và độ tin cậy của bộ điều khiển ở biên. Việc khám phá trong thế giới thực cũng tiêu tốn tuổi thọ cơ cấu chấp hành và thời gian của kỹ thuật viên, khiến hiệu quả mẫu trở thành một ràng buộc vận hành chứ không chỉ là một chỉ số thuật toán.
Isaac Lab hỗ trợ mô phỏng song song trên GPU, xây dựng môi trường và các quy trình học tăng cường. MuJoCo cung cấp mô phỏng vật lý cho nghiên cứu điều khiển. Gymnasium chuẩn hóa các giao diện môi trường. SERL đóng gói một hệ thống học robot hiệu quả về mẫu xoay quanh dữ liệu có trước, tính toán phần thưởng, reset và bộ điều khiển. Các công cụ này chuẩn hóa việc thực thi, nhưng không công cụ nào quyết định liệu một quan sát, một điều kiện kết thúc, hay một nhãn phần thưởng có thực sự đại diện cho tác vụ mong muốn hay không.
Trên cả RLPD, SERL và nghiên cứu VLA-RFT được trích dẫn ở đây, công thức huấn luyện kết hợp dữ liệu có trước với việc tối ưu hóa chính sách tiếp theo, thay vì dựa vào học tăng cường trực tuyến không ràng buộc từ đầu. Minh họa khởi tạo hành vi, dữ liệu ngoại tuyến hỗ trợ việc học giá trị, mô phỏng cung cấp trải nghiệm rộng nhưng gần đúng, và tương tác thực tế ở mức giới hạn điều chỉnh những gì chuyển giao kém. RLPD cung cấp bằng chứng cho việc trộn các quỹ đạo có trước với học trực tuyến, trong khi SERL cho thấy chất lượng bộ điều khiển, việc reset, cách tính phần thưởng và các chi tiết triển khai là một phần của phương pháp chứ không phải hạ tầng phụ trợ ngẫu nhiên (Ball et al.; Luo et al.).
Mô phỏng đã được xác lập để mở rộng quy mô khám phá trong các hệ thống nghiên cứu được khảo sát ở đây, đặc biệt ở những nơi mà ngã, va chạm hay trạng thái khởi tạo ngẫu nhiên sẽ tốn kém nếu thực hiện trên phần cứng. Các phương pháp Sim2Real như domain randomization thay đổi kết cấu, hình học, động lực học và đặc tính cảm biến để giảm sự phụ thuộc vào một cấu hình mô phỏng duy nhất. Tài liệu được trích dẫn không xác lập một phân phối randomization hay một cách biểu diễn phần thưởng phổ quát nào, vì cả hai đều phụ thuộc vào tác vụ, robot và môi trường triển khai.
Đánh giá và vận hành tạo thành một khoảng cách dai dẳng giữa bài báo và triển khai thực tế trong các hệ thống được thảo luận ở đây. Một bài báo có thể huấn luyện trên một thiết bị cố định với các lần reset theo kịch bản và một nhà nghiên cứu theo dõi lỗi. Một hệ thống đã triển khai phải phát hiện các trạng thái không an toàn, khắc phục hoặc dừng lại, lưu giữ log có thể truy vết, và phân biệt lỗi chính sách với lỗi cảm biến, bộ điều khiển, hay việc gán nhãn. Do đó học tăng cường chỉ sẵn sàng cho sản xuất trong phạm vi các ứng dụng có giới hạn rõ ràng, nơi phần thưởng, biên an toàn và quy trình reset đã được xác thực cho chính hệ thống đó.
Sai lệch trong đặc tả phần thưởng: Một đại lượng thay thế như tiếp xúc, độ sâu hay thời lượng tác vụ có thể bị tối ưu hóa mà không đạt được kết quả vật lý mong muốn. Kotwel có thể xử lý phần đặc tả dữ liệu và ranh giới đánh giá, nhưng việc xác định mục tiêu kinh doanh vẫn thuộc về đội robot.
Phản hồi thưa và trễ: Một nhãn thành công duy nhất ở bước kết thúc cung cấp rất ít thông tin về hành động nào trước đó đã gây ra thất bại. Kotwel có thể giúp xác định ranh giới sự kiện và các trạng thái quan sát trung gian khi chúng được hỗ trợ bởi dữ liệu cảm biến.
Chất lượng dữ liệu: Trôi đồng hồ, mất khung hình, trạng thái robot lỗi thời và các cờ kết thúc không nhất quán làm hỏng các bộ ba chuyển tiếp mà cả bộ học ngoại tuyến lẫn trực tuyến đều sử dụng. Kotwel có thể xử lý các đặc tả gán nhãn và kiểm soát chất lượng cho những bản ghi này.
Quyền riêng tư và tuân thủ: Các luồng camera và âm thanh thu thập tại nhà, bệnh viện và nơi làm việc có thể chứa con người, tài liệu, màn hình hoặc lời nói không liên quan đến tác vụ. Kotwel có thể giúp xác định các quy tắc che khuất và kiểm soát truy cập, trong khi việc diễn giải pháp lý và cấp phép triển khai nằm ngoài phạm vi.
Hiệu quả mẫu và an toàn: Việc khám phá trên phần cứng tiêu tốn thời gian và có thể làm hỏng vật thể hoặc thiết bị. Đây vẫn là một vấn đề chung giữa thuật toán, điều khiển, phần cứng và vận hành, chứ không chỉ là vấn đề gán nhãn.
Một hướng dẫn gán nhãn phần thưởng không còn cho ra một câu trả lời duy nhất khi một đầu nối vượt qua độ sâu mục tiêu trong chốc lát, nảy lại, rồi rời khỏi tầm nhìn camera trước khi episode kết thúc. Một cách diễn giải hợp lý là đánh dấu thành công tại lần vượt ngưỡng đã xác nhận đầu tiên, điều này dạy cho mô hình đạt đến tư thế danh định. Một cách khác chỉ đánh dấu thành công sau khi đầu nối giữ nguyên vị trí trong một khoảng thời gian quan sát xác định, điều này dạy cho mô hình sự kiên trì dưới động lực học tiếp xúc. Kotwel đưa quyết định đó ra ánh sáng trước khi gán nhãn quy mô lớn, gắn nó với các bằng chứng về lực, tư thế và video sẵn có, và ghi lại quy tắc đã chọn cùng các ví dụ ranh giới để đảm bảo việc rà soát nhất quán. Kotwel có thể thiết kế và kiểm toán đặc tả dữ liệu cho các sự kiện phần thưởng và chất lượng quỹ đạo; Kotwel không chọn mục tiêu của đội robot, không thiết kế chính sách, và không chứng nhận an toàn phần cứng.
Các cuộc kiểm toán đặc tả sự kiện phần thưởng có thể kiểm tra xem các nhãn thành công, thất bại, can thiệp và reset có tương ứng với kết quả vận hành mà đội robot mô tả hay không.
Các buổi rà soát chất lượng replay ngoại tuyến có thể phát hiện sự gián đoạn trong chuyển tiếp, lỗi dấu thời gian và các trạng thái kết thúc không nhất quán trước khi một thuật toán diễn giải chúng như trải nghiệm.
Việc ánh xạ phần thưởng đa nguồn có thể ghi lại những trường nào có thể so sánh được khi minh họa, các lượt chạy mô phỏng và các lần thử trong thế giới thực cùng đi vào một bộ đệm replay.
Học tăng cường bổ sung việc tối ưu hóa dựa trên hậu quả vào quá trình huấn luyện chính sách robot, nhưng thiết kế phần thưởng quyết định hành vi thực sự mà bộ học theo đuổi.
Dữ liệu ngoại tuyến, minh họa và mô phỏng giúp giảm việc khám phá trong thế giới thực nhưng không loại bỏ nhu cầu xác thực trên phần cứng.
Mức độ sẵn sàng cho sản xuất phụ thuộc vào việc reset, các kiểm soát an toàn, log có thể truy vết và các sự kiện phần thưởng đã hiệu chuẩn, không kém gì phụ thuộc vào thuật toán học.
Việc gán nhãn phần thưởng và quỹ đạo là các vấn đề đặc tả khi bằng chứng cảm biến cho phép nhiều hơn một cách diễn giải hợp lý.
Không có phương pháp nào tốt hơn một cách phổ quát. Behavior cloning thường đơn giản hơn khi các minh họa bao phủ được các trạng thái mà robot sẽ gặp phải, trong khi học tăng cường trở nên hữu ích khi hậu quả về sau, việc khắc phục sai sót, hoặc quá trình khám phá mang lại thông tin mà minh họa đã bỏ sót.
Một robot có thể được huấn luyện hoàn toàn trong mô phỏng, nhưng việc triển khai vẫn đòi hỏi xác thực trên chính phần cứng mục tiêu. Khả năng chuyển giao phụ thuộc vào việc bộ mô phỏng có bao phủ được động lực học, cảm biến, tiếp xúc, độ trễ và nhiễu loạn quan trọng đối với tác vụ hay không.
Một phần thưởng ở bước kết thúc là hợp lý khi thành công có thể được quan sát một cách đáng tin cậy và quá trình khám phá có thể đạt tới nó. Trong các tác vụ dài hoặc nhiều tiếp xúc, phản hồi thưa có thể khiến việc gán công và quá trình khám phá trở nên bất khả thi, vì vậy các nhóm có thể bổ sung minh họa, tín hiệu trung gian, hoặc các giai đoạn chương trình học tăng dần.
Một bản ghi ngoại tuyến nên lưu giữ quan sát, hành động, dấu thời gian, phần thưởng, loại kết thúc, cấu hình robot và cảm biến, cùng đủ thông tin xuất xứ để diễn giải cách episode đó được thu thập. Lược đồ chính xác phụ thuộc vào thuật toán và tác vụ, nhưng việc thiếu ngữ nghĩa về thời gian hoặc kết thúc có thể làm thay đổi bản chất của chuyển tiếp mà bộ học nhìn thấy.