Phỏng vấn

Lior Hakim, Đồng sáng lập & CTO của Hour One – Loạt phỏng vấn

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Lior Hakim, Đồng sáng lập và Giám đốc kỹ thuật của Hour One, một công ty hàng đầu trong lĩnh vực tạo ra các nhân vật ảo cho giao tiếp video chuyên nghiệp. Các nhân vật ảo giống như thật, được mô hình hóa độc quyền dựa trên người thật, truyền tải sự biểu cảm giống như con người thông qua văn bản, cho phép các doanh nghiệp nâng cao thông điệp của mình với sự dễ dàng và khả năng mở rộng không precedent.

Bạn có thể chia sẻ câu chuyện về sự hình thành của Hour One?

Nguồn gốc của Hour One có thể được truy tìm lại từ sự tham gia của tôi trong lĩnh vực tiền điện tử. Sau khi tham gia vào lĩnh vực này, tôi bắt đầu suy nghĩ về điều gì sẽ là điều lớn tiếp theo mà điện toán đám mây có thể tận dụng và khi học máy đang trở nên phổ biến trong lĩnh vực khuyến nghị và phân tích dự đoán, tôi đã làm việc trên một số dự án liên quan đến cơ sở hạ tầng học máy. Thông qua công việc này, tôi đã trở nên quen thuộc với các công việc tạo sinh đầu tiên và đặc biệt quan tâm đến GANs vào thời điểm đó. Tôi đã sử dụng tất cả các tính toán mà tôi có thể để kiểm tra những công nghệ mới này. Khi tôi展示 kết quả cho một người bạn có công ty trong lĩnh vực này, anh ấy nói với tôi rằng có thể cả hai chúng tôi sẽ không lãng phí thời gian của nhau. Oren, người đồng sáng lập và Giám đốc điều hành của Hour One, là một nhà đầu tư sớm vào AI vào thời điểm đó và trong khi chúng tôi đứng ở những vị trí khác nhau, chúng tôi đều đang di chuyển theo cùng một hướng, và việc thành lập Hour One để trở thành “Ngôi nhà của Con người ảo” là một hành trình không thể tránh khỏi.

Một số thuật toán học máy được sử dụng là gì, và phần nào của quá trình là Trí tuệ tạo sinh?

Trong lĩnh vực tạo video, các thuật toán học máy là rất quan trọng ở mọi giai đoạn. Ở giai đoạn viết kịch bản, các mô hình ngôn ngữ lớn (LLM) cung cấp sự hỗ trợ vô giá, tạo ra hoặc tinh chỉnh nội dung để đảm bảo các câu chuyện hấp dẫn. Khi chúng tôi chuyển sang âm thanh, các thuật toán Text-to-Speech (TTS) biến văn bản thành giọng nói tự nhiên,富 có cảm xúc. Khi chuyển sang biểu diễn trực quan, mô hình nền tảng đa phương tiện của chúng tôi về con người ảo đóng vai trò trung tâm. Mô hình này, được tăng cường bởi các mạng đối抗 (GANs) và các mã hóa tự động biến đổi (VAEs), có khả năng truyền tải cảm xúc, phát âm và biểu diễn hấp dẫn, chân thực. Các kỹ thuật tạo sinh này biến văn bản và âm thanh thành hình ảnh giống như thật của con người ảo, dẫn đến đầu ra video siêu thực. Sự kết hợp của LLM, TTS, GAN, VAE và mô hình đa phương tiện của chúng tôi làm cho Trí tuệ tạo sinh không chỉ là một phần mà là xương sống của sản xuất video hiện đại.

Hour One khác biệt với các công cụ tạo video khác như thế nào?

Ở Hour One, sự khác biệt của chúng tôi với các công cụ tạo video khác không đến từ việc quan tâm đến cạnh tranh, mà từ một triết lý sâu sắc chi phối cách tiếp cận của chúng tôi về chất lượng, thiết kế sản phẩm và chiến lược thị trường. Nguyên tắc hướng dẫn của chúng tôi là luôn ưu tiên yếu tố con người, đảm bảo rằng các sáng tạo của chúng tôi mang lại sự chân thực và cảm xúc. Chúng tôi tự hào về việc cung cấp chất lượng tốt nhất trong ngành mà không cần phải thỏa hiệp. Bằng cách sử dụng việc kết xuất video 3D tiên tiến, chúng tôi mang lại cho người dùng một trải nghiệm điện ảnh đích thực. Hơn nữa, chiến lược của chúng tôi là duy nhất và có quan điểm; chúng tôi bắt đầu với một sản phẩm được hoàn thiện và sau đó nhanh chóng lặp lại để đạt đến sự hoàn hảo. Cách tiếp cận này đảm bảo rằng các sản phẩm của chúng tôi luôn đi trước và thiết lập các tiêu chuẩn mới trong việc tạo video.

Với kinh nghiệm rộng lớn về GPU, bạn có thể chia sẻ một số quan điểm về NVIDIA Next-Generation GH200 Grace Hopper Superchip Platform (NVDA )?

Kiến trúc Grace Hopper thực sự là một yếu tố thay đổi cuộc chơi. Nếu GPU có thể hoạt động hiệu quả từ bộ nhớ RAM của máy chủ mà không bị tắc nghẽn hoàn toàn, nó sẽ mở ra các tỷ lệ mô hình/tăng tốc hiện không thể trong quá trình đào tạo và do đó, sự linh hoạt mong muốn trong việc đào tạo các công việc. Giả sử toàn bộ cổ phiếu GH200 sẽ không bị nuốt bởi việc đào tạo LLM, chúng tôi hy vọng sẽ sử dụng nó để giảm đáng kể chi phí tạo mẫu cho các kiến trúc đa phương tiện của chúng tôi trong tương lai.

Có những con chip nào khác đang trong tầm ngắm của bạn?

Mục tiêu chính của chúng tôi là cung cấp cho người dùng nội dung video có tính cạnh tranh về giá. Do nhu cầu về GPU có bộ nhớ lớn hiện tại, chúng tôi liên tục tối ưu hóa và thử nghiệm mọi dịch vụ GPU trên các nhà cung cấp dịch vụ đám mây hàng đầu. Hơn nữa, chúng tôi phấn đấu để trở nên độc lập về nền tảng trên một số công việc của chúng tôi. Do đó, chúng tôi đang theo dõi các TPU và ASIC khác, cũng như chú ý đến AMD. Cuối cùng, bất kỳ con đường tối ưu hóa nào dựa trên phần cứng có thể dẫn đến tỷ lệ FLOPs/giá tốt hơn sẽ được khám phá.

Visions của bạn về các tiến bộ trong tương lai của việc tạo video là gì?

Trong vòng 24 tháng, chúng ta sẽ không thể phân biệt được giữa một con người được tạo ra và một con người được quay. Điều đó sẽ thay đổi nhiều thứ và chúng tôi đang ở tiền phong của những tiến bộ đó.

Hiện tại, hầu hết các video được tạo ra đều dành cho máy tính và thiết bị di động, điều gì cần thay đổi trước khi chúng ta có hình ảnh ảo và thế giới được tạo ra một cách chân thực cho cả thực tế ảo và thực tế tăng cường?

Hiện tại, chúng tôi đã có khả năng tạo ra hình ảnh ảo và thế giới chân thực cho cả thực tế ảo và thực tế tăng cường. Vấn đề chính là độ trễ. Trong khi việc cung cấp đồ họa chất lượng cao, thời gian thực cho các thiết bị như kính thực tế ảo và thực tế tăng cường là rất quan trọng, việc đạt được điều này một cách mượt mà phụ thuộc vào nhiều yếu tố. Trước hết, chúng tôi phụ thuộc vào sự tiến bộ trong sản xuất chip để đảm bảo quá trình xử lý nhanh hơn và hiệu quả hơn. Bên cạnh đó, tối ưu hóa việc tiêu thụ năng lượng là rất quan trọng để đảm bảo thời gian sử dụng lâu hơn mà không ảnh hưởng đến trải nghiệm. Cuối cùng, chúng tôi dự đoán sẽ có những đột phá về phần mềm có thể kết nối hiệu quả giữa việc tạo ra và việc kết xuất thời gian thực. Khi những yếu tố này kết hợp lại, chúng ta sẽ thấy sự gia tăng trong việc sử dụng hình ảnh ảo và môi trường chân thực trên cả hai nền tảng thực tế ảo và thực tế tăng cường.

Bạn dự đoán sẽ là bước đột phá tiếp theo trong lĩnh vực AI?

Khi nói đến bước đột phá quan trọng tiếp theo trong lĩnh vực AI, luôn có một không khí phấn khích và mong đợi. Mặc dù tôi đã đề cập đến một số tiến bộ trước đó, điều mà tôi có thể chia sẻ là chúng tôi đang tích cực làm việc trên một số đổi mới đột phá tại thời điểm này. Tôi muốn đi sâu vào các chi tiết, nhưng hiện tại, tôi khuyến khích mọi người theo dõi các bản phát hành sắp tới của chúng tôi. Tương lai của AI mang lại nhiều hứa hẹn và chúng tôi rất hân hạnh được ở tiền phong của những nỗ lực tiên phong này. Hãy theo dõi!

Có điều gì khác mà bạn muốn chia sẻ về Hour One?

Bạn nên kiểm tra kênh Discord và API của chúng tôi, những bổ sung mới cho nền tảng của chúng tôi tại Hour One.

Antoine là một nhà lãnh đạo có tầm nhìn và là đối tác sáng lập của Unite.AI, được thúc đẩy bởi niềm đam mê không ngừng nghỉ để định hình và quảng bá tương lai của AI và robot. Là một doanh nhân hàng loạt, ông tin rằng AI sẽ gây ra sự gián đoạn cho xã hội giống như điện, và thường được bắt gặp khi nói về tiềm năng của các công nghệ phá vỡ và AGI.

Là một nhà tương lai học, ông dành để khám phá cách những đổi mới này sẽ định hình thế giới của chúng ta. Ngoài ra, ông là người sáng lập của Securities.io, một nền tảng tập trung vào đầu tư vào các công nghệ tiên tiến đang định nghĩa lại tương lai và thay đổi toàn bộ lĩnh vực.