Dịch vụ Đa phương thức
Dịch vụ Đa phương thức (Multimodal Service) đề cập đến một hệ thống AI hoặc phần mềm có khả năng xử lý, hiểu và tạo thông tin từ nhiều loại đầu vào dữ liệu cùng một lúc. Không giống như các hệ thống đơn phương thức truyền thống chỉ xử lý văn bản hoặc chỉ xử lý hình ảnh, dịch vụ đa phương thức kết hợp các luồng dữ liệu khác nhau—chẳng hạn như văn bản, hình ảnh, âm thanh, video và dữ liệu cảm biến—để tạo ra sự hiểu biết phong phú và toàn diện hơn về một tác vụ hoặc truy vấn.
Trong bối cảnh kỹ thuật số phức tạp ngày nay, giao tiếp của con người vốn dĩ là đa phương thức. Chúng ta hiếm khi xử lý thông tin qua một kênh duy nhất. Các dịch vụ đa phương thức cho phép máy móc mô phỏng khả năng nhận thức ở cấp độ con người này, dẫn đến các ứng dụng trực quan hơn, mạnh mẽ hơn và nhận biết ngữ cảnh tốt hơn. Khả năng này rất quan trọng đối với trải nghiệm người dùng thế hệ mới và tự động hóa tiên tiến.
Cơ chế cốt lõi bao gồm các bộ mã hóa chuyên biệt cho từng phương thức dữ liệu. Ví dụ, bộ mã hóa hình ảnh xử lý các điểm ảnh thành một vector số, trong khi bộ mã hóa văn bản chuyển đổi các từ thành các nhúng (embeddings). Sau đó, dịch vụ sử dụng một lớp hợp nhất (fusion layer)—thường sử dụng kiến trúc transformer—để căn chỉnh và kết hợp các vector rời rạc này thành một biểu diễn thống nhất. Vector thống nhất này sau đó được truyền đến một bộ giải mã (decoder) để tạo ra một đầu ra phù hợp, có thể là văn bản, một hình ảnh khác, hoặc một hành động.
Khái niệm này có sự chồng chéo đáng kể với AI Tạo sinh (Generative AI), vốn tập trung vào việc tạo ra nội dung mới, và các Mô hình Nền tảng (Foundation Models), là các mô hình lớn được huấn luyện trước có khả năng thích ứng với nhiều tác vụ khác nhau trên các phương thức khác nhau.