Flux 3 của Black Forest Labs tích hợp khả năng dự đoán hình ảnh, video, âm thanh và hành động robot trong một mô hình duy nhất. Dưới đây là những thông tin về Flux 3 và tầm quan trọng của nó.
Flux 3 là gì?
Flux 3 là một mô hình đa phương thức mới từ Black Forest Labs, tạo ra hình ảnh, video, âm thanh và dự đoán hành động robot từ một kiến trúc thống nhất duy nhất. Thay vì các mô hình riêng biệt được ghép nối với nhau cho từng nhiệm vụ, Black Forest Labs đã huấn luyện một kiến trúc xương sống duy nhất xử lý tất cả chúng, đó là lý do tại sao công ty và những người quan sát ban đầu mô tả nó là “đa phương thức của đa phương thức”. Nó kế thừa Flux 2, một mô hình hình ảnh mã nguồn mở được sử dụng rộng rãi ra mắt vào năm 2024, và hiện đang được triển khai thông qua chương trình truy cập sớm thay vì ra mắt công khai.

Kiến trúc thống nhất của Flux 3 hoạt động như thế nào?
Ý tưởng cốt lõi là một hệ thống xương sống chung được huấn luyện đồng thời trên nhiều phương thức. Black Forest Labs không huấn luyện một mô hình video, sau đó là một mô hình âm thanh riêng biệt, rồi một mô hình hình ảnh riêng biệt và ghép chúng lại với nhau bằng logic định tuyến. Mô hình học các biểu diễn có thể chuyển đổi trên dữ liệu hình ảnh, video, âm thanh và hành động cùng một lúc. Đó là một cách tiếp cận khác biệt đáng kể so với hầu hết các công cụ video AI dành cho người tiêu dùng, thường kết hợp trình tạo video dựa trên khuếch tán với lớp âm thanh hoặc đồng bộ cử động môi được thêm vào.
Kết quả thực tiễn: Những khả năng được xây dựng trên cùng một “sự hiểu biết” cơ bản về thế giới, cho dù đó là cách ánh sáng hoạt động trong khung hình video hay cách một bộ kẹp robot nên di chuyển để lấy lại vật thể bị rơi. Black Forest Labs mô tả nỗ lực này như một bước tiến tới “trí tuệ hình ảnh thế giới thực”, các mô hình nhận thức, dự đoán và hành động trên cả môi trường kỹ thuật số và vật lý, chứ không chỉ đơn thuần là tạo ra những pixel thuyết phục.
Việc triển khai được thực hiện theo từng giai đoạn. Việc tạo video với âm thanh gốc sẽ được thực hiện trước tiên. Tính năng dự đoán hành động đang được thử nghiệm với một số ít đối tác nghiên cứu và thương mại, bắt đầu với Mimic Robotics. Việc tạo và chỉnh sửa hình ảnh sẽ được triển khai sau đó, được hé lộ bằng bản xem trước nhưng chưa có ngày ra mắt cụ thể. Quyền truy cập mở vào toàn bộ kiến trúc đa phương thức được hứa hẹn, mặc dù thời gian biểu khá mơ hồ, "trong những tuần và tháng tới".
Tại sao việc tạo video lại được ra mắt trước việc tạo hình ảnh?
Đây là một trong những lựa chọn trái ngược với trực giác nhất trong bản phát hành này. Việc chuyển đổi văn bản thành hình ảnh là một lĩnh vực đã có nhiều thành tựu. Các công cụ như Flux 2, Midjourney và nhiều mô hình diffusion khác nhau đã giúp việc tổng hợp hình ảnh chất lượng cao trở nên gần như hoàn thiện đối với rất nhiều trường hợp sử dụng hàng ngày. Video thì chưa đạt đến trình độ đó. Nó đòi hỏi nhiều tài nguyên tính toán hơn, khó duy trì tính nhất quán về mặt thời gian hơn, và thị trường đã được định hình lại nhiều lần trong năm qua bởi các bản phát hành như Sora 2 và SeaDance 2.0, cả hai đều đã nâng cao tiêu chuẩn cho việc tạo video "đủ tốt".
Bằng cách dẫn đầu với video và âm thanh gốc, Black Forest Labs đang nhắm mục tiêu vào phần của kiến trúc đa phương thức nơi vẫn còn tồn tại khoảng trống mã nguồn mở lớn nhất. Hầu hết các công cụ tạo video mạnh nhất hiện nay đều là phần mềm mã nguồn đóng, độc quyền và đắt đỏ khi vận hành ở quy mô lớn. Một đối thủ cạnh tranh mã nguồn mở đạt được chất lượng tương đương sẽ rất quan trọng đối với các nhà phát triển muốn tinh chỉnh, tự host hoặc xây dựng các sản phẩm thương mại mà không phụ thuộc vào API và giá cả của một nhà cung cấp duy nhất.
Liệu Flux 3 có thực sự là mối đe dọa đối với Sora 2?
Còn quá sớm để khẳng định điều này một cách chắc chắn, vì Flux 3 vẫn đang trong giai đoạn truy cập giới hạn và chưa được các nhà thử nghiệm độc lập hoặc cộng đồng nhà phát triển rộng lớn hơn so sánh trực tiếp. Nhưng cách nhìn nhận này là hợp lý. Sora 2 và các mô hình video khép kín tương tự đặt ra tiêu chuẩn cao về tính chân thực, đồng bộ âm thanh và tính mạch lạc. Theo tài liệu truy cập sớm mà Black Forest Labs đã chia sẻ, các ví dụ video của Flux 3 được cho là đang tiến gần đến chất lượng đó, và việc nó hướng tới những trọng số mở là yếu tố khác biệt quan trọng nhất đối với các nhà phát triển.
Black Forest Labs có thành tích đáng kể trong lĩnh vực này. Flux 2, ra mắt năm 2024, đã trở thành lựa chọn mặc định được khuyến nghị cho việc tạo ảnh mã nguồn mở và vẫn được nhiều mô hình ngôn ngữ coi là một lựa chọn thay thế mã nguồn mở hàng đầu, ngay cả khi các công cụ độc quyền mới hơn đã ra mắt. Công ty dường như ưu tiên việc trì hoãn phát hành cho đến khi chúng sẵn sàng rộng rãi hơn là phát hành sớm và cải tiến liên tục, đó là một phần lý do tại sao Flux 3 đang thu hút sự chú ý ngay cả trước khi được phát hành rộng rãi.
Nếu Flux 3 cung cấp các trọng số mở với chất lượng video gần bằng Sora 2 hoặc SeaDance, đó sẽ là một bước chuyển đổi có ý nghĩa đối với bất kỳ ai đang xây dựng các sản phẩm cần tạo video tự host hoặc có thể tinh chỉnh thay vì một API bị khóa.
Tóm tắt
- Flux 3 là một mô hình xương sống được huấn luyện duy nhất, tạo ra hình ảnh, video với âm thanh gốc và dự đoán hành động robot, thay vì ghép nối các mô hình chuyên biệt riêng lẻ.
- Black Forest Labs đang triển khai mô hình này theo từng giai đoạn, bắt đầu với việc tạo video và âm thanh gốc, sau đó là dự đoán hành động thông qua những đối tác được lựa chọn, tiếp theo là tạo và chỉnh sửa hình ảnh.
- Sự hợp tác với Mimic Robotics sử dụng mô hình xương sống Flux để xây dựng cái mà các công ty gọi là mô hình hành động video, được tinh chỉnh dựa trên dữ liệu hành vi robot để dự đoán những hành động vật lý thay vì pixel.
- Các bản demo ban đầu cho thấy một cánh tay robot xử lý những nhiệm vụ không có cấu trúc như cáp và hướng vật thể bất thường, cùng với sự hợp tác với Audi về các nhiệm vụ sản xuất khéo léo như lắp đặt viền cửa sổ.
- Black Forest Labs coi Flux 3 là một bước tiến hướng tới việc truy cập mở cho một mô hình đa năng có thể nhận thức, dự đoán và hành động trong cả môi trường kỹ thuật số và vật lý.
- Việc tạo video sẽ được triển khai trước việc tạo hình ảnh, điều này đáng chú ý khi xét đến mức độ hoàn thiện của các công cụ chuyển đổi văn bản thành hình ảnh và nhu cầu chưa được giải quyết về video chất lượng cao vẫn còn tồn tại. Hiện tại, quyền truy cập được yêu cầu thông qua một mẫu đơn trên trang web của Black Forest Labs, và các tính năng đầy đủ hứa hẹn sẽ được cung cấp "trong những tuần và tháng tới".
Hướng dẫn AI
Học IT
AI
Hàm Excel