Phỏng vấn
Kismat Singh, Đồng sáng lập và Giám đốc điều hành của MachGen AI – Loạt phỏng vấn

Kismat Singh, Đồng sáng lập và Giám đốc điều hành của MachGen AI, là một giám đốc hạ tầng AI và kỹ thuật với hơn hai thập kỷ kinh nghiệm xây dựng các hệ thống tính toán hiệu năng cao và học máy. Trước khi đồng sáng lập MachGen AI, Singh từng giữ chức vụ Phó Chủ tịch Kỹ thuật cho AI Frameworks tại Intel và trước đó đã giữ các vị trí kỹ sư cao cấp tại NVIDIA, AMD, HP và các công ty công nghệ khác. Công việc của ông bao gồm đóng góp vào các thư viện học sâu và trình biên dịch, tối ưu hoá khung AI, và cải thiện độ bền của việc đào tạo quy mô siêu lớn. Tại Intel, ông đã tham gia chặt chẽ vào các sáng kiến PyTorch của công ty và công khai nói về việc làm cho các khung AI trở nên dễ tiếp cận hơn trên các nền tảng phần cứng khác nhau.
MachGen AI là một công ty hạ tầng AI tập trung vào việc làm cho các mô hình hình ảnh và video sinh ra nhanh hơn đáng kể và chi phí thấp hơn khi chạy. Được thành lập bởi Kismat Singh và Manoj Krishnan, công ty đang phát triển một ngăn xếp suy luận và tinh chỉnh hiệu suất cao, được thiết kế đặc biệt cho các mô hình khuếch tán thay vì điều chỉnh hạ tầng ban đầu được xây dựng cho các mô hình ngôn ngữ lớn. MachGen tối ưu các lĩnh vực bao gồm tính toán chú ý, bộ nhớ đệm, nhân GPU, quản lý bộ nhớ, song song, lập lịch và triển khai để giảm độ trễ sinh ra trong khi vẫn duy trì chất lượng mô hình. Nền tảng của nó cung cấp các API cho chuyển đổi văn bản thành hình ảnh, hình ảnh thành hình ảnh, văn bản thành video, hình ảnh thành video và tham chiếu thành video, với công nghệ nền tảng nhằm hỗ trợ các ứng dụng có độ trễ thấp như tạo nội dung tương tác, avatar thời gian thực, trò chơi và quảng cáo cá nhân.
Bạn đã dành hơn hai thập kỷ làm việc trên video, tính toán GPU và hiệu năng AI, bao gồm TensorRT tại NVIDIA, phần mềm AI tại Intel, tối ưu hoá GPU tại AMD, và công việc trước đó về mã hoá video thời gian thực. Bạn đã thấy gì trong những năm đó khiến bạn cuối cùng quyết định rời các công ty công nghệ lớn và đồng sáng lập MachGen, và tại sao bạn tin rằng suy luận khuếch tán là vấn đề hạ tầng đáng để xây dựng một công ty quanh nó?
Bạn đồng sáng lập Manoj và tôi đã chơi cầu lông tại cùng một phòng tập trong gần 10 năm. Trong phần lớn thời gian đó, chúng tôi luôn cố gắng tuyển dụng người còn lại. Cuối cùng chúng tôi quyết định rằng hợp tác với nhau dễ dàng hơn là tiếp tục tuyển dụng lẫn nhau.
Lý do chúng tôi chọn vấn đề này là vì cả hai đã chứng kiến một ngăn xếp suy luận phát triển từ bên trong. Tôi đã giúp xây dựng đội ngũ nền tảng suy luận của NVIDIA và sau đó lãnh đạo phần mềm AI tại Intel. Manoj đã xây dựng hạ tầng đào tạo mô hình lớn phía sau PyTorch tại Meta. Chúng tôi đã quan sát nhiều năm công việc về bộ nhớ đệm, batch, lập lịch và các nhân biến đổi hệ thống nghiên cứu LLM ban đầu thành hạ tầng sản xuất phục vụ hàng nghìn tỷ token.
Khuếch tán hiện đang ở mức tương tự như suy luận LLM cách đây ba năm. Các mô hình ảnh và video đã tiến bộ nhanh chóng, nhưng các hệ thống phục vụ chúng vẫn chậm, tốn kém và khó mở rộng. Hầu hết hạ tầng hiện có được thiết kế cho LLM, và khuếch tán chỉ được thêm vào sau.
Ba yếu tố khiến thời điểm này trở nên phù hợp: các mô hình đã đủ tốt để xây dựng các sản phẩm thực tế, vấn đề này đòi hỏi đúng những kỹ năng mà chúng tôi đã dành cả sự nghiệp để phát triển, và tác động của nó đủ lớn để xây dựng một công ty thế hệ. Khi một video mà trước đây mất vài phút để tạo ra có thể được sinh ra trong vài giây với một phần chi phí, việc tạo nội dung tương tác, quảng cáo cá nhân hoá, avatar thời gian thực và các sản phẩm sáng tạo hoàn toàn mới trở nên khả thi.
MachGen cho rằng nhiều kỹ thuật đã biến đổi suy luận mô hình ngôn ngữ lớn không chuyển đổi một cách suôn sẻ sang mô hình khuếch tán. Điều gì cơ bản khác biệt khi phục vụ các mô hình ảnh và video, và đâu là những nút thắt hiệu năng lớn nhất mà hạ tầng AI truyền thống thường bỏ qua?
LLM và mô hình khuếch tán có các mẫu tính toán cơ bản khác nhau. LLM là tự hồi quy, với một giai đoạn prefill nặng về tính toán sau đó là quá trình giải mã token‑theo‑token bị ràng buộc bởi bộ nhớ. Các kỹ thuật như bộ nhớ đệm KV và tách riêng prefill/giải mã được thiết kế dựa trên cấu trúc đó.
Mô hình khuếch tán không tự hồi quy và vẫn bị ràng buộc bởi tính toán trong suốt quá trình giảm nhiễu. Việc tạo video cũng liên quan đến lượng lớn dữ liệu không gian và thời gian, tạo ra các yêu cầu khác nhau về attention, bộ nhớ, giao tiếp và song song.
Do đó, nhiều tối ưu hoá được phát triển cho LLM không chuyển đổi một cách suôn sẻ. Bộ nhớ đệm KV truyền thống không giải quyết cùng một vấn đề, song song tiêu chuẩn có thể gây ra chi phí giao tiếp đáng kể, và các nhân mã nguồn mở hiện có còn kém trưởng thành hơn nhiều. Trình lập lịch, mô hình bộ nhớ, chiến lược bộ nhớ đệm, các nhân và song song đều cần được thiết kế quanh khuếch tán. Đó là lý do chúng tôi xây dựng MachGen với khuếch tán như một thành phần cấp một.
MachGen báo cáo độ trễ thấp hơn khoảng 4–6 lần trên một số mô hình ảnh và cải thiện khoảng 6 lần trên một số mô hình video khi chạy các mô hình gốc, chưa được tinh luyện. Những đột phá kỹ thuật quan trọng nhất phía sau những cải tiến này là gì, và làm thế nào bạn đảm bảo rằng việc cải thiện hiệu năng không làm giảm chất lượng đầu ra?
Các cải tiến đến từ việc nhiều phần của ngăn xếp làm việc cùng nhau. Attention chiếm phần lớn ngân sách tính toán trong nhiều mô hình video, vì vậy chúng tôi tập trung vào các công thức độ chính xác thấp hơn, attention thưa và các kỹ thuật liên quan. Chúng tôi cũng đã phát triển các phương pháp bộ nhớ đệm khai thác tính dư thừa không gian và thời gian, các kernel được tối ưu cao cho kiến trúc khuế tán, và các kỹ thuật song song giảm chi phí giao tiếp.
Khi kết hợp lại, những cải tiến đó cho phép MachGen cung cấp HiDream trong một giây so với sáu giây và Flux trong 1,5 giây so với 6,2 giây. Đối với video, Wan 2.2 chạy trong 16,5 giây so với 98 giây, trong khi LTX 2.3 chạy trong 10,7 giây so với 67 giây. Chi phí suy luận cũng thấp hơn 2–4 lần đối với các mô hình hình ảnh và 2–3 lần đối với video.
Các kết quả này sử dụng các mô hình gốc, chưa được tinh luyện. Chúng tôi đang cải thiện cách các mô hình chạy mà không làm giảm chất lượng đầu ra. Đối với việc áp dụng trong sản xuất, tốc độ, chi phí và chất lượng đều phải hoạt động đồng thời.
Trusted TV là một ví dụ thú vị vì việc giảm thời gian tạo từ phút xuống giây thay đổi nhiều hơn chỉ là chi phí hạ tầng. Khi việc tạo video đủ nhanh để sản xuất hàng ngàn chiến dịch và các biến thể sáng tạo cá nhân hoá, những mô hình kinh doanh hoặc trải nghiệm sản phẩm mới nào sẽ trở nên khả thi mà trước đây không thể thực hiện?
TrustedTV giúp các doanh nghiệp tạo ra các quảng cáo truyền hình sẵn sàng phát sóng bằng AI và phân phối chúng trên các nền tảng TV kết nối như Prime Video, Roku và DirecTV. Nhiều khách hàng của họ là các doanh nghiệp nhỏ. Việc tạo một quảng cáo truyền hình theo cách truyền thống đòi hỏi đội quay và biên tập, với chi phí bắt đầu từ hàng nghìn đô la và thường lên tới hàng chục nghìn đô la. Trusted TV đưa chi phí đó về mức không có gì. Một chủ doanh nghiệp nhỏ có thể tạo một quảng cáo đầy đủ từ điện thoại thông minh trong khoảng năm phút và xem trước khi phải trả bất kỳ khoản nào. Hơn 10.000 chiến dịch đã được tạo trên nền tảng này.
Ian, CEO của Trusted TV, đã thấy tiêu chuẩn độ trễ của MachGen trên Artificial Analysis và không tin vào nó. Anh ấy đã đăng ký để tự mình thử nghiệm. Lần render đầu tiên của anh ấy trả về sau khoảng 25 giây mà không mất chất lượng, và khi chạy các bài kiểm tra đồng thời, các cải tiến vẫn duy trì ở quy mô lớn. Họ đã chuyển toàn bộ quy trình sản xuất sang MachGen trong vòng chưa đầy 48 giờ, và MachGen hiện đang cung cấp năng lực cho tất cả các video mới của họ. Trong lần triển khai mới nhất, chúng tôi đã gần đạt 10 hoặc 11 giây cho mô hình đó, và sẽ tiếp tục cải thiện.
Hiệu ứng sản phẩm là các nhà quảng cáo ngừng tạo một hoặc hai quảng cáo chung. Người dùng của họ sẽ xoay vòng hai hoặc ba quảng cáo mới mỗi tuần, thử nghiệm sáng tạo trên các phân khúc khán giả khác nhau và lặp lại thay vì cam kết cố định. Điều tiếp theo sẽ là cá nhân hoá theo địa lý và mức độ khán giả ở quy mô lớn, điều mà trước đây chỉ dành cho các công ty có ngân sách hàng triệu đô la.
Một phiên bản tôi nghĩ đến cá nhân: Hiện nay, tôi nhận được một quảng cáo giày thể thao được quay trên một con phố ở Manhattan. Tôi sống ở khu vực Vịnh, vì vậy nó không có ý nghĩa gì với tôi. Điều tôi muốn là cùng một quảng cáo nhưng có dãy núi Mission Peak ở phía sau. Đó không phải là một quảng cáo rẻ hơn; đó là một dạng quảng cáo khác, và nó chỉ trở nên khả thi về mặt kinh tế khi việc tạo ra nhanh và rẻ đủ để sản xuất hàng ngàn biến thể.
Các công ty nhúng việc tạo hình ảnh hoặc video trực tiếp vào sản phẩm nên suy nghĩ như thế nào về kinh tế của suy luận? Ở quy mô nào việc tối ưu sử dụng GPU trở nên quan trọng chiến lược hơn là chỉ trả tiền cho mỗi lần tạo cho nhà cung cấp API?
Điểm bẻ cong xuất hiện khi suy luận bắt đầu ảnh hưởng đến trải nghiệm khách hàng hoặc lợi nhuận của công ty.
Một API đa năng có thể hợp lý khi một đội đang xác thực sản phẩm. Khi việc tạo trở thành trung tâm của sản phẩm đó, các đội cần nhìn xa hơn mức giá niêm yết cho mỗi đầu ra. Độ trễ, khả năng đồng thời, chất lượng, độ tin cậy và việc sử dụng GPU đều trở thành một phần của kinh tế.
Việc tạo có thể trông rẻ, nhưng nếu người dùng phải chờ vài phút và từ bỏ quy trình, nó vẫn tạo ra vấn đề kinh doanh. Kiến trúc yêu cầu khả năng GPU tăng đồng thời với mức sử dụng cũng sẽ gây áp lực ngày càng lên lợi nhuận.
Không có một ngưỡng khối lượng yêu cầu duy nhất vì nhu cầu tính toán cho một clip 540p ngắn rất khác so với video 1080p dài hơn. Việc tối ưu trở nên chiến lược khi mức sử dụng tăng gây chi phí tăng gần như cùng tỷ lệ, nhu cầu cao tạo hàng đợi, hoặc độ trễ bắt đầu hạn chế trải nghiệm sản phẩm.
MachGen hoạt động trên nhiều lớp, bao gồm kernel GPU tùy chỉnh, bộ nhớ đệm, tối ưu độ chính xác, lập lịch và song song. Khi các mô hình tiếp tục phát triển nhanh chóng, lớp nào của ngăn xếp suy luận bạn cho là còn tiềm năng lớn nhất để cải thiện đáng kể tốc độ và chi phí?
Đối với việc tạo video, attention là một trong những cơ hội còn lại lớn nhất vì nó chiếm phần lớn ngân sách tính toán trong nhiều mô hình. Vẫn còn nhiều không gian để cải thiện các công thức độ chính xác thấp hơn, attention thưa và các kernel attention đặc thù cho khuế tán.
Attention chỉ là một phần của cơ hội. Những cải tiến tổng thể lớn nhất sẽ đến từ việc kết hợp các cải tiến trên toàn ngăn xếp. Bộ nhớ đệm là một ví dụ. Các kỹ thuật lưu trữ KV được dùng trong LLM không chuyển trực tiếp, nhưng các mô hình khuế tán chứa tính dư thừa không gian và thời gian có thể được khai thác bằng cách tiếp cận phù hợp.
Tính song song mang lại một cơ hội khác. Thêm GPU không tự động tạo ra tốc độ tăng tỷ lệ vì chi phí giao tiếp có thể làm mất lợi thế. Chúng tôi phát triển các kernel được tùy chỉnh để giao tiếp chồng lên tính toán không phụ thuộc dữ liệu và đưa chúng vào pipeline cùng với công việc phụ thuộc dữ liệu.
Cơ chế attention, bộ nhớ đệm, kernel, tính song song, bộ nhớ và lập lịch đều ảnh hưởng lẫn nhau. Tối ưu chỉ một lớp cuối cùng sẽ tạo ra nút thắt ở nơi khác. Những cải tiến lớn nhất sẽ đến từ việc xem toàn bộ ngăn xếp như một hệ thống hoàn chỉnh được thiết kế cho đặc điểm tính toán của diffusion.
Với các mô hình video mới đẩy thời gian tạo gần hơn tới thời gian thực, chúng ta đã gần bao nhiêu tới việc video sinh tương tác thực sự, và những rào cản kỹ thuật nào còn cần được khắc phục trước khi việc tạo video thời gian thực trở nên phổ biến?
Chúng tôi đã đạt được tốc độ tương tác cho một số ứng dụng. MachGen tạo video Vidu Q3 Turbo dài năm giây ở độ phân giải 720p trong khoảng sáu giây và ở 540p dưới ba giây. Tốc độ này đủ nhanh cho việc lặp lại sáng tạo nhanh chóng và đưa các avatar phản hồi nhanh và video tương tác vào tầm tay.
Một ví dụ về cách tôi hiểu tương tác. Hãy tưởng tượng bạn đang xem một câu chuyện, và bạn có thể thấy kết thúc sẽ đi về hướng nào, nhưng bạn không thích nó. Thay vì ngồi im lặng, bạn điều chỉnh lại: hai nhân vật đó nên đi tìm hiểu những gì nhân vật thứ ba đang giấu, và đối mặt với hắn thay vì để câu chuyện diễn ra như cũ. Nội dung bạn điều khiển thay vì nội dung bạn nhận được. Đó là những gì việc tạo nhanh, rẻ giá mang lại, và nó thay đổi hầu hết mọi thứ chúng ta tiêu thụ.
Đạt được mục tiêu thường đòi hỏi hơn một tiêu chuẩn độ trễ mạnh. Toàn bộ trải nghiệm phải duy trì tính phản hồi khi chịu tải lưu lượng sản xuất đồng thời giữ được chất lượng hình ảnh, tính nhất quán khung hình và chi phí dự đoán được. Video dài hơn, độ phân giải cao hơn và các yêu cầu đồng thời đều làm tăng gánh nặng hạ tầng, và hệ thống vẫn phải cung cấp khả năng, định tuyến yêu cầu, và khôi phục sau lỗi phần cứng mà người dùng không nhận thấy.
Nó sẽ xuất hiện từng trường hợp sử dụng một. Các đoạn clip ngắn, avatar, trò chơi và công cụ sáng tạo có khả năng sẽ đến đầu tiên vì thời gian tạo tính bằng giây đã đủ cho chúng. Khi chất lượng mô hình và hiệu năng suy luận cải thiện đồng thời, nhiều ứng dụng hơn sẽ vượt qua ngưỡng đó.
Khi các AI agent ngày càng tạo hình ảnh và video một cách tự động thay vì chờ người dùng nhấn nút, điều này sẽ thay đổi yêu cầu hạ tầng như thế nào? Các khối lượng công việc do agent điều khiển có tạo ra những nhu cầu cơ bản khác nhau về độ trễ, đồng thời, chi phí và độ tin cậy không?
Một agent biến một yêu cầu người dùng duy nhất thành hàng chục hoặc hàng trăm công việc tạo. Nó tạo ra nhiều lựa chọn, đánh giá chúng, chỉnh sửa prompt và lặp lại quá trình, mà không có sự can thiệp của con người giữa các bước.
Điều đó làm cho độ trễ, đồng thời, chi phí và độ tin cậy trở nên quan trọng hơn rất nhiều. Nếu mỗi lần tạo mất vài phút, quy trình làm việc của agent sẽ quá chậm để hữu ích. Nếu mỗi lần thử tốn kém, việc lặp lại tự động sẽ trở nên không thực tế về mặt kinh tế. Hệ thống cũng cần xử lý nhiều yêu cầu đồng thời một cách đáng tin cậy vì một lỗi duy nhất có thể làm gián đoạn toàn bộ chuỗi công việc.
Đây là nơi các khả năng như cung cấp GPU, tự động mở rộng và định tuyến quan trọng không kém việc tối ưu ở mức mô hình. Nhu cầu từ agent có tính bùng nổ cao hơn nhiều so với nhu cầu từ một ứng dụng sáng tạo nơi người dùng chỉ nhấn một nút.
Đơn vị công việc liên quan không còn là một hình ảnh hay video đơn lẻ. Đó là vòng lặp đầy đủ của việc tạo, đánh giá và tinh chỉnh nội dung. Hạ tầng phải làm cho toàn bộ vòng lặp này nhanh, chi phí hợp lý và đáng tin cậy.
Có sự cạnh tranh khốc liệt giữa các nhà cung cấp GPU, dịch vụ đám mây suy luận, nhà phát triển mô hình và các nền tảng tối ưu hoá. Khi phần cứng ngày càng nhanh hơn, tại sao các công ty vẫn cần một lớp suy luận chuyên biệt như MachGen thay vì dựa vào các cải tiến từ NVIDIA, AMD, các nhà cung cấp đám mây, hoặc chính các nhà phát triển mô hình?
Phần cứng nhanh hơn nâng cao giới hạn. Phần mềm quyết định mức độ đạt được của giới hạn đó.
Chúng ta đã thấy điều này xảy ra với các LLM. Các bộ tăng tốc mới cải thiện hiệu năng thô qua mỗi thế hệ, và việc batch liên tục, quản lý KV‑cache, giải mã dự đoán và các kernel chuyên biệt vẫn là yếu tố đưa ngành công nghiệp đạt được thông lượng và kinh tế ở mức sản xuất. Không có gì trong số đó đến từ phần cứng.
Việc tối ưu liên tục toàn bộ quy trình sản xuất cho việc tạo hình ảnh và video là một công việc khác so với những gì các nhà cung cấp phần cứng, nhà cung cấp đám mây và nhà phát triển mô hình đang thực hiện, và không phải là ưu tiên cốt lõi của bất kỳ ai trong số họ.
Có một vài cách tiếp cận công việc này. Một cách là mô hình thị trường, nơi các mô hình được tập hợp và định hướng yêu cầu. Chúng tôi không cho rằng cách này có thể duy trì lâu dài, vì không có sự kiểm soát đối với lớp mà hiệu năng tồn tại. Chúng tôi chọn tự xây dựng ngăn xếp và lưu trữ nội địa, đây là cách duy nhất để đạt được các con số về độ trễ và chi phí mà chúng tôi quan sát được.
Điều đó có nghĩa là điều chỉnh attention, caching, kernels, độ chính xác, bộ nhớ và mức độ song song cho từng mô hình và từng bộ tăng tốc, đồng thời hỗ trợ các API được quản lý, đám mây chuyên dụng và triển khai tự lưu trữ. Khi số lượng mô hình và các tùy chọn phần cứng tăng lên, độ phức tạp cũng tăng theo. Vai trò của chúng tôi là hấp thụ chúng để khách hàng của chúng tôi có thể dành thời gian cho những gì tạo nên sự khác biệt cho sản phẩm của họ.
Bạn đã mô tả các mô hình thế giới như một phần trong tầm nhìn dài hạn của MachGen, với nhiều đặc điểm tính toán của chúng giống các khối lượng công việc khuế tán. Cơ sở hạ tầng cho các mô hình thế giới quy mô sản xuất cần như thế nào, và những ứng dụng nào sẽ trở nên khả thi nếu việc tạo và mô phỏng môi trường hình ảnh cuối cùng trở nên rẻ và phản hồi nhanh như việc tạo văn bản hiện nay?
Một cách để suy nghĩ về nền tảng của chúng tôi là tương tự như một LLM đa năng. Cùng một mô hình soạn thảo một hợp đồng pháp lý và trả lời câu hỏi về nhà hàng. Đối với chúng tôi, cùng một ngăn xếp phục vụ các công ty tạo avatar video, quảng cáo AI, việc tạo câu chuyện và microdrama, và cuối cùng là các mô hình thế giới. Các ngành dọc khác nhau, nhưng cùng một tập hợp các vấn đề hiệu năng cơ bản.
Các mô hình thế giới không phải là kinh doanh cốt lõi của chúng tôi hiện nay, nhưng chúng là mục tiêu chúng tôi đang hướng tới và chúng tôi đang tích cực phát triển chúng. Các mô hình thế giới quy mô sản xuất sẽ cần thông lượng rất cao và độ trễ rất thấp vì chúng liên tục tạo và cập nhật môi trường thay vì chỉ tạo ra một đầu ra duy nhất. Chúng cũng cần tính nhất quán không gian và thời gian, khả năng phản hồi lại các hành động, và thường là khả năng mô phỏng đồng thời nhiều kết quả khả thi. Điều này tạo ra những vấn đề khó khăn về bộ nhớ, di chuyển dữ liệu, mức độ song song và độ tin cậy. Một mô hình thế giới điều khiển robot hoặc trò chơi không thể mất vài phút để tạo ra trạng thái tiếp theo. Hiệu năng quyết định liệu những hệ thống này có thể sử dụng được hay không.
Về mặt tính toán, các mô hình thế giới hiện nay giống rất nhiều với các mô hình khuế tán, vì vậy ngăn xếp mà chúng tôi đang xây dựng hiện là nền tảng tự nhiên. Hiện chưa có lớp phục vụ ở cấp độ sản xuất hoàn thiện cho chúng, tương đương với những gì đã tồn tại cho các LLM. Chúng tôi dự định sẽ xây dựng lớp này.
Nếu việc mô phỏng trở nên phản hồi nhanh và chi phí thấp như việc tạo văn bản hiện nay, robot có thể luyện tập các tình huống hiếm trước khi gặp chúng, trò chơi có thể tạo ra môi trường phản hồi với từng người chơi, và các nhà thiết kế có thể thử nghiệm hàng chục khả năng trước khi xây dựng trong thế giới thực. Khuế tán là lĩnh vực chúng tôi đang kiếm sống ngày hôm nay. Các mô hình thế giới là ngọn sao Bắc của chúng tôi.
Cảm ơn bạn đã tham gia buổi phỏng vấn tuyệt vời, những độc giả muốn tìm hiểu thêm nên truy cập MachGen AI.












