Khi nói đến thu thập dữ liệu AI, một câu hỏi thường được đặt ra là:
Cần bao nhiêu dữ liệu?
Nhưng với Physical AI, có một câu hỏi quan trọng không kém:
Dữ liệu cần chứa những tình huống nào?
10.000 video của cùng một thao tác chưa chắc có giá trị bằng một bộ dữ liệu được thiết kế để bao phủ nhiều vật thể, nhiều hành động và nhiều điều kiện môi trường khác nhau.
Đó là lý do dịch vụ dữ liệu Physical AI của Saltlux Technology được triển khai theo từng yêu cầu và bài toán cụ thể.
Thiết kế trước khi thu thập
Trước khi bắt đầu, bài toán cần được phân tích thành những thành phần nhỏ hơn:
Environment – môi trường
Object – vật thể
Task – nhiệm vụ
Action – hành động
Condition – điều kiện thực hiện
Ví dụ, với một bài toán cầm nắm, chỉ riêng một nhiệm vụ đã có thể tạo ra nhiều trường hợp: vật thể lớn hoặc nhỏ, đặt cao hoặc thấp, nằm ngang hoặc đứng, dễ cầm hoặc khó cầm.
Lab giúp kiểm soát – thực địa tạo sự đa dạng
Hai môi trường có vai trò khác nhau.

Trong phòng Lab, các điều kiện có thể được kiểm soát và lặp lại. Điều này phù hợp để kiểm thử kịch bản, chuẩn hóa quy trình và thu thập những nhóm dữ liệu cụ thể.Sau đó, hoạt động có thể được mở rộng ra thực địa.

Tại đây xuất hiện những yếu tố khó có thể tạo đầy đủ trong phòng Lab: không gian thực, ánh sáng tự nhiên, nhiều vật thể, vật cản và những tình huống phát sinh trong quá trình thao tác.
Kết hợp hai nguồn giúp dataset vừa có tính kiểm soát, vừa có tính đa dạng.
Dữ liệu không dừng lại ở bước thu thập
Dữ liệu thô sau khi ghi nhận chưa phải là dataset hoàn chỉnh.
Phía sau còn là quá trình kiểm tra chất lượng, tổ chức dữ liệu, đồng bộ các nguồn dữ liệu và chuẩn hóa theo yêu cầu của dự án.
Một pipeline có thể được hình dung:
Task Design
→ Lab Collection
→ Field Collection
→ Synchronization
→ Quality Control
→ Data Processing
→ Annotation
→ Dataset
Tùy từng dự án, cấu trúc và mức độ xử lý dữ liệu có thể khác nhau.
Dịch vụ có thể mở rộng theo bài toán
Với khả năng kết hợp thu thập trong Lab và triển khai thực địa, Saltlux Technology hướng tới cung cấp dịch vụ dữ liệu theo yêu cầu cho các nhóm bài toán như Physical AI, Robot Learning, Computer Vision, Human Demonstration và nghiên cứu tương tác giữa con người – máy móc.
Thay vì chỉ cung cấp dữ liệu thô, mục tiêu là xây dựng một quy trình:
Từ yêu cầu của bài toán → đến dữ liệu có thể sử dụng cho AI.


