Phỏng vấn
Anand Kannappan, CEO & Co-founder của Patronus AI – Phỏng vấn

Anand Kannappan là Đồng sáng lập và CEO của Patronus AI, nền tảng đánh giá và bảo mật AI tự động đầu tiên trong ngành để giúp các doanh nghiệp phát hiện ra sai sót của LLM tại quy mô lớn. Trước đó, Anand đã lãnh đạo các nỗ lực về giải thích ML và thí nghiệm tiên tiến tại Meta Reality Labs.
Điều gì ban đầu thu hút bạn đến với khoa học máy tính?
Khi lớn lên, tôi luôn bị thu hút bởi công nghệ và cách nó có thể được sử dụng để giải quyết các vấn đề thực tế. Ý tưởng về việc tạo ra một thứ gì đó từ đầu bằng cách sử dụng chỉ một máy tính và mã code đã làm tôi tò mò. Khi tôi đi sâu vào khoa học máy tính, tôi nhận ra tiềm năng khổng lồ mà nó nắm giữ cho sự đổi mới và chuyển đổi trong các ngành công nghiệp khác nhau. Sự thúc đẩy này để đổi mới và tạo ra sự khác biệt là điều ban đầu thu hút tôi đến với khoa học máy tính.
Bạn có thể chia sẻ câu chuyện về sự ra đời của Patronus AI?
Sự ra đời của Patronus AI là một hành trình thú vị. Khi OpenAI ra mắt ChatGPT, nó trở thành sản phẩm tiêu dùng phát triển nhanh nhất, thu hút hơn 100 triệu người dùng chỉ trong hai tháng. Sự áp dụng rộng rãi này đã làm nổi bật tiềm năng của AI tạo sinh, nhưng nó cũng làm nổi bật sự do dự của các doanh nghiệp khi triển khai AI với tốc độ nhanh như vậy. Nhiều doanh nghiệp lo lắng về những sai sót và hành vi không thể đoán trước của các mô hình ngôn ngữ lớn (LLM).
Rebecca và tôi đã biết nhau nhiều năm, khi cùng học khoa học máy tính tại Đại học Chicago. Tại Meta, chúng tôi đều phải đối mặt với những thách thức trong việc đánh giá và giải thích đầu ra của máy học – Rebecca từ góc độ nghiên cứu và tôi từ góc độ ứng dụng. Khi ChatGPT được công bố, chúng tôi đều nhìn thấy tiềm năng chuyển đổi của LLM nhưng cũng hiểu sự thận trọng mà các doanh nghiệp đang thực hiện.
Điểm chuyển đổi đến khi anh trai tôi, một ngân hàng đầu tư, Piper Sandler, quyết định cấm truy cập OpenAI nội bộ. Điều này khiến chúng tôi nhận ra rằng mặc dù AI đã tiến bộ đáng kể, vẫn còn một khoảng trống trong việc áp dụng doanh nghiệp do lo ngại về độ tin cậy và bảo mật. Chúng tôi thành lập Patronus AI để giải quyết khoảng trống này và tăng cường niềm tin của doanh nghiệp vào AI tạo sinh bằng cách cung cấp một lớp đánh giá và bảo mật cho LLM.
Bạn có thể mô tả chức năng cốt lõi của nền tảng Patronus AI trong việc đánh giá và bảo mật LLM?
Sứ mệnh của chúng tôi là tăng cường niềm tin của doanh nghiệp vào AI tạo sinh. Chúng tôi đã phát triển nền tảng đánh giá và bảo mật tự động đầu tiên trong ngành dành riêng cho LLM. Nền tảng của chúng tôi giúp các doanh nghiệp phát hiện ra sai sót trong đầu ra của LLM tại quy mô lớn, cho phép họ triển khai sản phẩm AI một cách an toàn và tự tin.
Nền tảng của chúng tôi tự động hóa một số quy trình chính:
- Đánh giá: Chúng tôi đánh giá hiệu suất của mô hình trong các kịch bản thực tế, tập trung vào các tiêu chí quan trọng như ảo giác và bảo mật.
- Tạo thử nghiệm: Chúng tôi tự động tạo bộ thử nghiệm đối thủ tại quy mô lớn để đánh giá nghiêm ngặt khả năng của mô hình.
- So sánh: Chúng tôi so sánh các mô hình khác nhau để giúp khách hàng xác định mô hình phù hợp nhất cho các trường hợp sử dụng cụ thể của họ.
Các doanh nghiệp ưa thích việc đánh giá thường xuyên để thích nghi với các mô hình, dữ liệu và nhu cầu người dùng đang phát triển. Nền tảng của chúng tôi hoạt động như một bên đánh giá thứ ba đáng tin cậy, cung cấp quan điểm không thiên vị tương tự như Moody’s trong không gian AI. Các đối tác đầu tiên của chúng tôi bao gồm các công ty AI hàng đầu như MongoDB (MDB ), Databricks, Cohere và Nomic AI, và chúng tôi đang trong quá trình thảo luận với một số công ty truyền thống có uy tín để thử nghiệm nền tảng của chúng tôi.
Loại sai sót hoặc “ảo giác” nào mà mô hình Lynx của Patronus AI phát hiện trong đầu ra của LLM, và làm thế nào nó giải quyết những vấn đề này cho các doanh nghiệp?
LLM thực sự là những công cụ mạnh mẽ, nhưng bản chất xác suất của chúng khiến chúng dễ bị “ảo giác”, hoặc sai sót nơi mô hình tạo ra thông tin không chính xác hoặc không liên quan. Những ảo giác này là vấn đề, đặc biệt là trong môi trường kinh doanh nhạy cảm cao nơi độ chính xác là quan trọng.
Truyền thống, các doanh nghiệp đã dựa vào việc kiểm tra thủ công để đánh giá đầu ra của LLM, một quá trình không chỉ tốn thời gian mà còn không thể mở rộng. Để đơn giản hóa điều này, Patronus AI đã phát triển Lynx, một mô hình chuyên dụng tăng cường khả năng của nền tảng của chúng tôi bằng cách tự động hóa việc phát hiện ảo giác. Lynx, được tích hợp trong nền tảng của chúng tôi, cung cấp phạm vi thử nghiệm toàn diện và đảm bảo hiệu suất mạnh mẽ, tập trung vào việc xác định các lỗi quan trọng có thể ảnh hưởng đáng kể đến hoạt động kinh doanh, như tính toán tài chính không chính xác hoặc lỗi trong việc xem xét tài liệu pháp lý.
Với Lynx, chúng tôi giảm thiểu những hạn chế của việc đánh giá thủ công thông qua thử nghiệm đối thủ tự động, khám phá một loạt các kịch bản thất bại tiềm năng. Điều này cho phép phát hiện ra các vấn đề có thể elude các nhà đánh giá con người, cung cấp cho các doanh nghiệp độ tin cậy và niềm tin để triển khai LLM trong các ứng dụng quan trọng.
FinanceBench được mô tả là điểm chuẩn đầu tiên trong ngành để đánh giá hiệu suất của LLM trên các câu hỏi tài chính. Những thách thức nào trong lĩnh vực tài chính đã thúc đẩy sự phát triển của FinanceBench?
FinanceBench được phát triển để đáp ứng những thách thức duy nhất mà lĩnh vực tài chính phải đối mặt khi áp dụng LLM. Các ứng dụng tài chính đòi hỏi độ chính xác và tin cậy cao, vì sai sót có thể dẫn đến tổn thất tài chính đáng kể hoặc vấn đề pháp lý. Mặc dù LLM có tiềm năng trong việc xử lý khối lượng lớn dữ liệu tài chính, nghiên cứu của chúng tôi cho thấy rằng các mô hình hiện đại như GPT-4 và Llama 2 gặp khó khăn khi trả lời các câu hỏi tài chính, thường không thể thu thập thông tin chính xác.
FinanceBench được tạo ra như một điểm chuẩn toàn diện để đánh giá hiệu suất của LLM trong các ngữ cảnh tài chính. Nó bao gồm 10.000 cặp câu hỏi và câu trả lời dựa trên tài liệu tài chính công khai, bao gồm các lĩnh vực như lý luận số, thu thập thông tin, lý luận logic và kiến thức thế giới. Bằng cách cung cấp điểm chuẩn này, chúng tôi nhằm giúp các doanh nghiệp hiểu rõ hơn về những hạn chế của các mô hình hiện tại và xác định các lĩnh vực cần cải thiện.
Phân tích ban đầu của chúng tôi cho thấy rằng nhiều LLM không đáp ứng được tiêu chuẩn cao cần thiết cho các ứng dụng tài chính, làm nổi bật nhu cầu phải tinh chỉnh và đánh giá có针 đối hơn. Với FinanceBench, chúng tôi đang cung cấp một công cụ quý giá cho các doanh nghiệp để đánh giá và nâng cao hiệu suất của LLM trong lĩnh vực tài chính.
Nghiên cứu của bạn đã chỉ ra rằng các mô hình AI hàng đầu, đặc biệt là GPT-4 của OpenAI, tạo ra nội dung có bản quyền với tỷ lệ đáng kể khi được yêu cầu với các đoạn trích từ các cuốn sách phổ biến. Bạn tin rằng những phát hiện này có những ý nghĩa gì về lâu dài đối với sự phát triển AI và ngành công nghệ rộng lớn hơn, đặc biệt là khi xem xét các cuộc tranh luận đang diễn ra xung quanh AI và luật bản quyền?
Vấn đề về các mô hình AI tạo ra nội dung có bản quyền là một vấn đề phức tạp và cấp bách trong ngành AI. Nghiên cứu của chúng tôi cho thấy rằng các mô hình như GPT-4, khi được yêu cầu với các đoạn trích từ các cuốn sách phổ biến, thường tái tạo nội dung có bản quyền. Điều này đặt ra những câu hỏi quan trọng về quyền sở hữu trí tuệ và ý nghĩa pháp lý của việc sử dụng nội dung tạo ra bởi AI.
Trong dài hạn, những phát hiện này nhấn mạnh nhu cầu về hướng dẫn và quy định rõ ràng hơn xung quanh AI và bản quyền. Ngành công nghiệp phải làm việc để phát triển các mô hình AI tôn trọng quyền sở hữu trí tuệ trong khi vẫn duy trì khả năng sáng tạo của chúng. Điều này có thể liên quan đến việc tinh chỉnh các tập dữ liệu đào tạo để loại bỏ nội dung có bản quyền hoặc triển khai các cơ chế phát hiện và ngăn chặn việc tái tạo nội dung được bảo vệ.
Ngành công nghệ rộng lớn hơn cần tham gia vào các cuộc thảo luận liên tục với các chuyên gia pháp lý, nhà hoạch định chính sách và các bên liên quan để thiết lập một khuôn khổ cân bằng giữa đổi mới và tôn trọng luật pháp hiện hành. Khi AI tiếp tục phát triển, điều quan trọng là phải giải quyết những thách thức này một cách chủ động để đảm bảo sự phát triển AI có trách nhiệm và đạo đức.
Đưa ra tỷ lệ đáng kể mà các mô hình LLM hàng đầu tái tạo nội dung có bản quyền, như được chứng minh bởi nghiên cứu của bạn, những bước nào bạn nghĩ các nhà phát triển AI và ngành công nghiệp nói chung cần thực hiện để giải quyết những lo ngại này? Hơn nữa, làm thế nào Patronus AI dự định đóng góp vào việc tạo ra các mô hình AI có trách nhiệm và tuân thủ pháp luật hơn trong ánh sáng của những phát hiện này?
Để giải quyết vấn đề về các mô hình AI tái tạo nội dung có bản quyền, một cách tiếp cận đa diện là cần thiết. Các nhà phát triển AI và ngành công nghiệp nói chung cần ưu tiên tính minh bạch và trách nhiệm trong việc phát triển mô hình AI. Điều này bao gồm:
- Cải thiện việc lựa chọn dữ liệu: Đảm bảo rằng các tập dữ liệu đào tạo được chăm sóc cẩn thận để tránh nội dung có bản quyền trừ khi có giấy phép phù hợp.
- Phát triển cơ chế phát hiện: Triển khai các hệ thống có thể xác định khi một mô hình AI tạo ra nội dung có bản quyền tiềm năng và cung cấp cho người dùng các tùy chọn để sửa đổi hoặc loại bỏ nội dung đó.
- Thiết lập tiêu chuẩn ngành: Hợp tác với các chuyên gia pháp lý và các bên liên quan trong ngành để tạo ra hướng dẫn và tiêu chuẩn cho việc phát triển AI tôn trọng quyền sở hữu trí tuệ.
Tại Patronus AI, chúng tôi cam kết đóng góp vào sự phát triển AI có trách nhiệm bằng cách tập trung vào đánh giá và tuân thủ. Nền tảng của chúng tôi bao gồm các sản phẩm như EnterprisePII, giúp các doanh nghiệp phát hiện và quản lý các vấn đề tiềm ẩn về quyền riêng tư trong đầu ra của AI. Bằng cách cung cấp những giải pháp này, chúng tôi nhằm mục đích trao quyền cho các doanh nghiệp sử dụng AI một cách có trách nhiệm và đạo đức trong khi giảm thiểu rủi ro pháp lý.
Với các công cụ như EnterprisePII và FinanceBench, bạn dự đoán những thay đổi nào trong cách các doanh nghiệp triển khai AI, đặc biệt là trong các lĩnh vực nhạy cảm như tài chính và dữ liệu cá nhân?
Những công cụ này cung cấp cho các doanh nghiệp khả năng đánh giá và quản lý đầu ra của AI một cách hiệu quả hơn, đặc biệt là trong các lĩnh vực nhạy cảm như tài chính và dữ liệu cá nhân.
Trong lĩnh vực tài chính, FinanceBench cho phép các doanh nghiệp đánh giá hiệu suất của LLM với độ chính xác cao, đảm bảo rằng các mô hình đáp ứng các yêu cầu nghiêm ngặt của các ứng dụng tài chính. Điều này trao quyền cho các doanh nghiệp tận dụng AI cho các nhiệm vụ như phân tích dữ liệu và ra quyết định với sự tự tin và độ tin cậy cao hơn.
Tương tự, các công cụ như EnterprisePII giúp các doanh nghiệp điều hướng các phức tạp của quyền riêng tư dữ liệu. Bằng cách cung cấp thông tin về các rủi ro tiềm ẩn và đề xuất giải pháp để giảm thiểu chúng, những công cụ này cho phép các doanh nghiệp triển khai AI một cách an toàn và có trách nhiệm hơn.
Tổng thể, những công cụ này đang mở đường cho một cách tiếp cận thông tin và chiến lược hơn đối với việc áp dụng AI, giúp các doanh nghiệp tận dụng lợi ích của AI trong khi giảm thiểu các rủi ro liên quan.
Làm thế nào Patronus AI làm việc với các công ty để tích hợp những công cụ này vào các triển khai LLM hiện có và luồng công việc của họ?
Tại Patronus AI, chúng tôi hiểu tầm quan trọng của việc tích hợp liền mạch khi nói đến việc áp dụng AI. Chúng tôi làm việc chặt chẽ với khách hàng của mình để đảm bảo rằng các công cụ của chúng tôi được tích hợp một cách dễ dàng vào các triển khai LLM và luồng công việc hiện có của họ. Điều này bao gồm việc cung cấp cho khách hàng:
- Kế hoạch tích hợp tùy chỉnh: Chúng tôi hợp tác với từng khách hàng để phát triển kế hoạch tích hợp được tùy chỉnh để phù hợp với nhu cầu và mục tiêu cụ thể của họ.
- Hỗ trợ toàn diện: Đội ngũ của chúng tôi cung cấp hỗ trợ liên tục trong suốt quá trình tích hợp, cung cấp hướng dẫn và hỗ trợ để đảm bảo một quá trình chuyển đổi trơn tru.
- Đào tạo và Giáo dục: Chúng tôi cung cấp các phiên đào tạo và tài nguyên giáo dục để giúp khách hàng hiểu và sử dụng đầy đủ các công cụ của chúng tôi, trao quyền cho họ để tối đa hóa đầu tư AI của mình.
Đưa ra sự phức tạp của việc đảm bảo rằng đầu ra của AI là an toàn, chính xác và tuân thủ các luật khác nhau, bạn sẽ đưa ra lời khuyên gì cho cả các nhà phát triển LLM và các công ty muốn sử dụng chúng?
Bằng cách ưu tiên sự hợp tác và hỗ trợ, chúng tôi nhằm mục đích làm cho quá trình tích hợp trở nên đơn giản và hiệu quả nhất có thể, cho phép các doanh nghiệp tận dụng tối đa các giải pháp AI của chúng tôi.
Sự phức tạp của việc đảm bảo rằng đầu ra của AI là an toàn, chính xác và tuân thủ các luật khác nhau tạo ra những thách thức đáng kể. Đối với các nhà phát triển LLM, chìa khóa là ưu tiên tính minh bạch và trách nhiệm trong suốt quá trình phát triển.
Một trong những khía cạnh cơ bản là chất lượng dữ liệu. Các nhà phát triển phải đảm bảo rằng các tập dữ liệu đào tạo được chăm sóc cẩn thận và không chứa nội dung có bản quyền trừ khi được cấp phép phù hợp. Điều này không chỉ giúp ngăn chặn các vấn đề pháp lý tiềm ẩn mà còn đảm bảo rằng AI tạo ra đầu ra đáng tin cậy. Ngoài ra, việc giải quyết các vấn đề về thiên vị và công bằng là rất quan trọng. Bằng cách tích cực làm việc để xác định và giảm thiểu thiên vị, và bằng cách phát triển dữ liệu đào tạo đa dạng và đại diện, các nhà phát triển có thể giảm thiểu thiên vị và đảm bảo kết quả công bằng cho tất cả người dùng.
Các thủ tục đánh giá mạnh mẽ là điều cần thiết. Việc triển khai các thử nghiệm và sử dụng các điểm chuẩn như FinanceBench có thể giúp đánh giá hiệu suất và độ tin cậy của các mô hình AI, đảm bảo rằng chúng đáp ứng các yêu cầu của các trường hợp sử dụng cụ thể. Hơn nữa, các xem xét về đạo đức nên được đặt lên hàng đầu. Việc tham gia với các khuôn khổ và hướng dẫn đạo đức đảm bảo rằng các hệ thống AI được phát triển một cách có trách nhiệm và phù hợp với các giá trị của xã hội.
Đối với các công ty muốn tận dụng LLM, việc hiểu khả năng của AI là rất quan trọng. Điều quan trọng là phải đặt ra kỳ vọng thực tế và đảm bảo rằng AI được sử dụng hiệu quả trong tổ chức. Sự tích hợp và hỗ trợ liền mạch cũng rất quan trọng. Bằng cách làm việc với các đối tác đáng tin cậy, các công ty có thể tích hợp các giải pháp AI vào luồng công việc hiện có và đảm bảo rằng các đội của họ được đào tạo và hỗ trợ để tận dụng AI một cách hiệu quả.
Tuân thủ và bảo mật nên được ưu tiên, với sự tập trung vào việc tuân thủ các quy định và luật bảo vệ dữ liệu liên quan. Các công cụ như EnterprisePII có thể giúp theo dõi và quản lý các rủi ro tiềm ẩn. Việc giám sát liên tục và đánh giá thường xuyên hiệu suất của AI cũng là cần thiết để duy trì độ chính xác và độ tin cậy, cho phép thực hiện các điều chỉnh khi cần thiết.
Cảm ơn vì cuộc phỏng vấn tuyệt vời, những người đọc muốn tìm hiểu thêm nên truy cập Patronus AI.












