Quan sát đa phương thức
Quan sát đa phương thức (Multimodal Observation) đề cập đến khả năng của một hệ thống AI trong việc xử lý, diễn giải và rút ra ý nghĩa từ nhiều loại đầu vào dữ liệu khác nhau cùng một lúc. Thay vì chỉ dựa vào văn bản hoặc chỉ dựa vào hình ảnh, một hệ thống đa phương thức tích hợp các luồng dữ liệu như thông tin thị giác (hình ảnh, video), thính giác (giọng nói, âm thanh môi trường) và văn bản để xây dựng sự hiểu biết toàn diện về một cảnh hoặc một sự kiện.
Trong các ứng dụng thực tế, thông tin hiếm khi được trình bày dưới một định dạng duy nhất. Một người quan sát sử dụng thị giác, thính giác và ngữ cảnh cùng nhau để hình thành một bức tranh hoàn chỉnh. Quan sát đa phương thức cho phép AI mô phỏng nhận thức toàn diện của con người, dẫn đến khả năng ra quyết định mạnh mẽ, tinh tế và chính xác hơn nhiều so với những gì các hệ thống đơn phương thức có thể đạt được.
Cơ chế cốt lõi bao gồm các bộ mã hóa chuyên biệt cho từng loại dữ liệu (ví dụ: CNN cho hình ảnh, Transformer cho văn bản, bộ phân tích phổ âm cho âm thanh). Các biểu diễn riêng lẻ này sau đó được ánh xạ vào một không gian nhúng chung, nhiều chiều. Trong không gian chung này, hệ thống học các mối tương quan và mối quan hệ giữa các phương thức khác nhau, cho phép nó suy luận xuyên suốt chúng.
Khái niệm này có liên quan chặt chẽ đến Truy xuất đa phương thức (Cross-Modal Retrieval), Học không mẫu (Zero-Shot Learning) và Hợp nhất cảm biến (Sensor Fusion), tất cả đều dựa trên việc tích hợp các nguồn dữ liệu khác biệt để nâng cao trí thông minh.