โมเดลและแพลตฟอร์ม AI

การแนะนำ Vertex AI

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

เมื่อพื้นที่ของปัญญาประดิษฐ์ (AI) กำลังพัฒนาอย่างรวดเร็ว หนึ่งในอุปสรรคที่ผู้นำด้านเทคโนโลยี thườngพบคือการเปลี่ยนแปลงจาก “การทดลอง” เป็น “การเตรียมพร้อมสำหรับองค์กร” ในขณะที่แชทบอทสำหรับผู้บริโภคและแพลตฟอร์มแบบโต้ตอบช่วยให้คนสามารถจินตนาการได้ แต่ธุรกิจไม่สามารถประสบความสำเร็จได้ด้วยเพียงอินเทอร์เฟซแชทเท่านั้น ในยุคที่การแข่งขันรุนแรงกว่าเดิม ธุรกิจต้องการระบบนิเวศที่มีความสามารถในการปรับขนาดและความปลอดภัย และนี่คือสิ่งที่ Google (GOOGL ) พยายามที่จะนำเสนอด้วย Vertex AI ซึ่งเป็นแพลตฟอร์ม AI และ Machine Learning ที่รวมเป็นหนึ่งของ Google Cloud

Vertex AI พยายามที่จะสร้างตัวเองให้เป็นกระดูกสันหลังของการรวม AI ที่สร้างขึ้น (Generative AI) กับโครงสร้างคลาวด์สมัยใหม่ โดยการนำเสนอชุดคุณสมบัติที่ครอบคลุมซึ่งเชื่อมช่องว่างระหว่างโมเดลพื้นฐานและแอปพลิเคชันระดับผลิต Vertex AI ไม่ใช่เพียงแค่ชั้นหุ้มสำหรับโมเดลภาษาขนาดใหญ่ (LLM) แต่เป็นระบบนิเวศ AI และ Machine Learning ที่รวมถึง Generative AI เป็นพลเมืองชั้นหนึ่งของโครงสร้างคลาวด์สมัยใหม่

ที่ใจกลางของ Vertex AI คือ Model Garden ซึ่งเป็นตลาดกลางที่ให้เข้าถึงโมเดลพื้นฐานมากกว่า 200 โมเดล รวมถึง Gemini 2.5 Pro ซึ่งเป็นโมเดลที่มีหน้าต่างบริบท 2 ล้านโทเคน ในบทความนี้ เราจะวิเคราะห์สถาปัตยกรรมของ Vertex AI และสำรวจว่า Model Garden ทำหน้าที่เป็น “App Store” สำหรับอุตสาหกรรม และดูถึงหลักการทางเทคนิคที่ทำให้แพลตฟอร์มนี้เป็นกระดูกสันหลังของซอฟต์แวร์องค์กรรุ่นต่อไป

สถาปัตยกรรมหลัก: แพลตฟอร์มที่รวมเป็นหนึ่ง

Vertex AI ไม่ใช่การรวบรวมเครื่องมือที่ไม่เชื่อมต่อกัน แต่เป็นระบบนิเวศ AI และข้อมูลที่ออกแบบมาเพื่อเชื่อมช่องว่างของข้อมูล เครื่องมือ และทีมที่ทำให้การเรียนรู้ของเครื่องมีปัญหา ในการพัฒนา AI แบบดั้งเดิม จะเกิดขึ้นในสภาพแวดล้อมที่แยกจากกัน และบางครั้งข้อมูลจะกระจายและถูกกักขังในหลายๆ ที่เก็บข้อมูล เช่น องค์กรอาจเก็บข้อมูลลูกค้าในคลังข้อมูล SQL ในขณะที่เอกสารที่ไม่มีโครงสร้างถูกทิ้งใน Data Lake เมื่อข้อมูลถูกกักขัง AI จะเห็นเพียง “ความจริงที่ไม่สมบูรณ์” ซึ่งนำไปสู่ผลลัพธ์ที่มีอคติหรืออัตราการหลอกลวงสูงเนื่องจากขาดบริบทขององค์กร

Vertex AI พยายามที่จะรวมชีวิตประจำวันของ AI ตั้งแต่การนำเข้าข้อมูลดิบใน BigQuery และ Cloud Storage ไปจนถึงการตรวจสอบการผลิต ซึ่งทำหน้าที่เป็น “เนื้อเยื่อเชื่อม” ระหว่างช่องว่างเหล่านี้ Vertex AI รวมเข้ากับ Cloud Storage และ BigQuery โดยตรง ทำให้โมเดล AI สามารถดึงข้อมูลได้โดยไม่ต้องใช้กระบวนการ Extraction, Transformation และ Load ที่ซับซ้อน

พื้นฐาน: AI Hypercomputer ของ Google

ชั้น GenAI ของ Vertex AI นั้นตั้งอยู่บนโครงสร้าง AI Hypercomputer ของ Google ซึ่งเป็นระบบซูเปอร์คอมพิวเตอร์ที่รวมถึง

TPU v5p และ v5e (Tensor Processing Units)

Tensor Processing Units ของ Google เป็น ASIC (Application-Specific Integrated Circuits) ที่ออกแบบมาโดยเฉพาะสำหรับการคูณเมทริกซ์ที่กำหนดการเรียนรู้ลึก

  • TPU v5p (Performance): นี่คือเครื่องเร่งความเร็วสำหรับการฝึกอบรมขนาดใหญ่ แต่ละ TPU v5p pod สามารถขยายได้ถึง 8,960 ชิปที่เชื่อมต่อกันด้วย Inter-Chip Interconnect (ICI) ของ Google ที่มีความกว้างแบนด์วิธสูงสุด 4,800 Gbps สำหรับผู้นำด้านเทคนิค สิ่งนี้หมายถึงการฝึกอบรมที่เร็วขึ้น 2.8 เท่าสำหรับโมเดล GPT-3 ขนาด 175B พารามิเตอร์ เมื่อเทียบกับรุ่นก่อนหน้า ทำให้สามารถลดเวลาในการเข้าถึงตลาดได้
  • TPU v5e (Efficiency): ออกแบบมาเพื่อประสิทธิภาพที่มีต้นทุนต่ำ v5e เป็นเครื่องมือหลักสำหรับการฝึกอบรมขนาดกลางและอินเฟอร์เรนซ์ที่มีการใช้งานสูง มันให้ประสิทธิภาพที่ดีขึ้น 2.5 เท่า ทำให้เป็นตัวเลือกที่เหมาะสำหรับธุรกิจที่ต้องการรันการอินเฟอร์เรนซ์ 24/7 โดยไม่ต้องมีงบประมาณขนาดใหญ่

NVIDIA H100/A100 GPUs สำหรับความยืดหยุ่น

ในขณะที่ TPU เป็นแบบเฉพาะเจาะจง ทีมพัฒนามากมายพึ่งพาเอกอสистем์ CUDA ของ NVIDIA Vertex AI ให้การสนับสนุนแบบ first-class สำหรับฮาร์ดแวร์ใหม่ล่าสุดของ NVIDIA:

  • NVIDIA H100 (Hopper): เหมาะสำหรับการปรับแต่งโมเดลที่ใหญ่ที่สุด เช่น Llama 3.1 405B ที่ต้องการแบนด์วิธเมมโมรี่ขนาดใหญ่
  • จูปิเตอร์ เน็ตเวิร์ก: เพื่อป้องกัน “ปัญหาการขาดแคลนเครือข่าย” Google ใช้เน็ตเวิร์กจูปิเตอร์ ซึ่งเป็นเน็ตเวิร์กแฟบริกของศูนย์ข้อมูล ทำให้ข้อมูลเคลื่อนผ่าน GPU ได้ด้วยความเร็วสูง โดยการสนับสนุน RDMA (Remote Direct Memory Access) เพื่อหลีกเลี่ยงการโอเวอร์เฮดของ CPU และให้ประสิทธิภาพที่ใกล้เคียงกับการใช้งานในโหนดที่กระจาย

การออร์เคสตราแบบไดนามิก

การเปลี่ยนแปลงทางเทคนิคที่สำคัญที่สุดใน Vertex AI คือ การออร์เคสตราแบบไดนามิก ในสภาพแวดล้อมแบบดั้งเดิม หากโหนด GPU ล้มเหลวระหว่างการฝึกอบรม 3 สัปดาห์ งานทั้งหมดอาจล้มเหลว

  • ความทนทานแบบอัตโนมัติ: Vertex AI ซึ่งมักจะถูกขับเคลื่อนโดย Google Kubernetes Engine (GKE) ภายใต้พื้นผิว มี “โหนดที่สามารถฟื้นตัวได้” หากมีการตรวจพบข้อผิดพลาดของฮาร์ดแวร์ แพลตฟอร์มจะย้ายโหลดงานไปยังโหนดที่มีสุขภาพดีโดยอัตโนมัติ
  • ตัวจัดตารางงานแบบไดนามิก: เครื่องมือนี้ช่วยให้ทีมสามารถขอความจุตามความเร่งด่วนได้ คุณสามารถเลือก Flex Start (ราคาถูกกว่า เริ่มต้นทันทีที่มีความจุ) หรือความจุที่รับประกันสำหรับการเปิดตัวที่สำคัญ
  • การฝึกอบรมแบบเซิร์ฟเวอร์เลส: สำหรับทีมที่ต้องการการจัดการโครงสร้างพื้นฐานเป็นศูนย์ การฝึกอบรมแบบเซิร์ฟเวอร์เลสของ Vertex AI ช่วยให้คุณสามารถส่งโค้ดและข้อมูลของคุณได้ แพลตฟอร์มจะจัดเตรียมคลัสเตอร์ รันงาน และทำลายคลัสเตอร์โดยอัตโนมัติ โดยคิดค่าบริการตามวินาทีการประมวลผลที่ใช้จริง

สามจุดเข้าถึง: การค้นพบ การทดลอง และการอัตโนมัติ

เพื่อให้เหมาะสมกับบุคลิกทางเทคนิคต่างๆ ตั้งแต่นักวิทยาศาสตร์ข้อมูลไปจนถึงนักพัฒนาแอปพลิเคชัน Vertex AI มีสามจุดเข้าถึงหลัก:

  • Model Garden: ตลาดสำหรับการค้นพบ
  • Vertex AI Studio: สนามทดลองสำหรับการทดลอง
  • Vertex AI Agent Builder: โรงงานสำหรับการอัตโนมัติ

Model Garden: ตลาดสำหรับการค้นพบ

Model Garden ของ Google Cloud คือแพลตฟอร์มกลางสำหรับการค้นพบ การทดสอบ การปรับแต่ง และการนำไปใช้ของโมเดล AI หลากหลาย รวมถึงโมเดลหลายรูปแบบ (การมองเห็น ข้อความ รหัส) สำหรับความต้องการทางธุรกิจต่างๆ โดยให้การผสานรวมอย่างราบรื่นกับเครื่องมือของ Vertex AI สำหรับการจัดการชีวิตวงจร AI ที่สตรีมไลน์

Model Garden จัดหมวดหมู่โมเดลมากกว่า 200 โมเดลออกเป็นสามระดับ ทำให้ kiến trúcสามารถสร้างสมดุลระหว่างประสิทธิภาพ ต้นทุน และการควบคุม:

  1. โมเดลของ Google: โมเดลหลายรูปแบบที่สำคัญของ Vertex AI มีให้เลือกหลายขนาด ตั้งแต่ Pro ที่มีการให้เหตุผลที่ซับซ้อนไปจนถึง Flash ที่มีความหน่วงต่ำและปริมาณสูง ทำให้นักพัฒนาสามารถปรับโมเดลให้เหมาะกับการใช้งานของตนได้
  2. โมเดลของบุคคลที่สาม (Proprietary): ผ่านการร่วมมือเชิงกลยุทธ์ Vertex AI นำเสนอ “Model-as-a-Service” (MaaS) สำหรับยักษ์ใหญ่ด้าน AI เช่น Anthropic (Claude 3.5) และ Mistral AI แทนที่จะจัดการการเรียกเก็บเงินและข้อมูลรับรองความปลอดภัยแยกกันสำหรับผู้ให้บริการ AI ห้าราย ทีมเทคนิคสามารถเข้าถึงทั้งหมดผ่านโครงการ Google Cloud ที่มีอยู่ โดยใช้รูปแบบ API ที่เป็นมาตรฐาน
  3. โมเดลโอเพ่นซอร์สและโอเพ่นเวท: ระดับนี้รวม Meta’s Llama 3.2, Mistral และ Gemma ของ Google ซึ่งเหมาะสำหรับองค์กรที่ต้องการติดตั้งโมเดลภายใน VPC (Virtual Private Cloud) ของตนเองเพื่อให้แน่ใจถึงการแยกข้อมูลสูงสุด

ใน環境ที่ไม่รวมเป็นหนึ่ง การนำโมเดลโอเพ่นซอร์สมาใช้ เช่น Llama จะต้องตั้งค่าสภาพแวดล้อม PyTorch คอนฟิกตัวขับ CUDA และจัดการราพเปอร์ Flask หรือ FastAPI

Model Garden ลดระยะเวลานี้ผ่าน จุดสิ้นสุดแบบจัดการ ซึ่งหมายถึง:

  • การนำไปใช้แบบคลิกเดียว: สำหรับหลายๆ โมเดล การคลิก “Deploy” จะจัดเตรียมทรัพยากร TPU/GPU ที่จำเป็น ห่อโมเดลในคอนเทนเนอร์ที่พร้อมสำหรับการผลิต และให้จุดสิ้นสุด API แบบ REST
  • การผสานรวม Hugging Face: Vertex AI อนุญาตให้นักพัฒนานำโมเดลมาจาก Hugging Face Hub และติดตั้งลงในจุดสิ้นสุดของ Vertex โดยให้การขยายความฉลาดที่เกือบจะไม่มีขอบเขต
  • การเชื่อมต่อแบบส่วนตัว (PSC): สำหรับอุตสาหกรรมที่มีการควบคุมอย่างเข้มงวด โมเดลสามารถถูกนำไปใช้โดยใช้ Private Service Connect ซึ่งรับประกันว่าจุดสิ้นสุดของโมเดลจะไม่ถูกเปิดเผยต่ออินเทอร์เน็ตสาธารณะ ทำให้การรับส่งข้อมูลอยู่ภายในเครือข่ายองค์กรเท่านั้น

Vertex AI Studio: สนามทดลองสำหรับการทดลอง

ในขณะที่ Model Garden มุ่งเน้นไปที่การค้นหา Vertex AI Studio มุ่งเน้นไปที่ ความแม่นยำ Vertex AI Studio เปรียบได้กับคอมไพล์เลอร์และดีบั๊กเกอร์ในโลกซอฟต์แวร์แบบดั้งเดิม สตูดิโอนี้เป็นพื้นที่ทำงานที่โมเดลดิบถูกหล่อหลอมให้เป็นเครื่องมือทางธุรกิจเฉพาะผ่านการผสมผสานระหว่างวิศวกรรมพรอมต์ การทดสอบหลายรูปแบบ และการปรับไฮเปอร์พารามิเตอร์ที่ซับซ้อน

การสร้างแบบจำลองหลายรูปแบบ: นอกเหนือจากข้อความ

คุณลักษณะเด่นของ Studio คือการสนับสนุน การทำงานหลายรูปแบบ โดยธรรมชาติ ในขณะที่แพลตฟอร์มอื่นๆ ต้องการการเขียนโค้ดที่ซับซ้อนเพื่อจัดการกับข้อมูลที่ไม่ใช่ข้อความ Vertex AI Studio อนุญาตให้คุณลากและวางไฟล์โดยตรงเข้าไปในอินเทอร์เฟซเพื่อทดสอบความสามารถในการให้เหตุผลของ Gemini 2.5

  • ความฉลาดด้านวิดีโอ: คุณสามารถอัปโหลดวิดีโอบทสัมภาษณ์ทางเทคนิคที่มีความยาว 45 นาทีและขอให้โมเดล “ระบุเวลาที่ API ถูกกล่าวถึงและให้สรุปที่มีเวลาเริ่มต้น”
  • การวิเคราะห์เอกสาร: แทนที่จะอ่านข้อความเพียงอย่างเดียว โมเดลสามารถวิเคราะห์ การวางผังภาพ ของ PDF ที่มี 1,000 หน้า โดยเข้าใจความสัมพันธ์ระหว่างแผนภูมิ ตาราง และข้อความที่อยู่รอบๆ
  • การดำเนินการโค้ด: สตูดิโอสนับสนุน การดำเนินการโค้ด ในพื้นที่เล่น หากคุณขอให้โมเดลแก้ปัญหาทางคณิตศาสตร์ที่ซับซ้อนหรือวิเคราะห์ CSV โมเดลสามารถเขียนและดำเนินการโค้ด Python ในสภาพแวดล้อมที่ปลอดภัยและแยกจากกันเพื่อให้ได้คำตอบที่ถูกตรวจสอบแล้ว

การปรับแต่งขั้นสูง: เส้นทางการปรับแต่ง

เมื่อการปรับแต่งพรอมต์ (Zero-shot หรือ Few-shot) ถึงขีดจำกัด Vertex AI Studio นำเสนอเครื่องมือหนัก: การปรับแต่งโมเดล

  1. การปรับแต่งแบบมีผู้ดูแล (SFT): นักพัฒนาสามารถให้เซตข้อมูล “พรอมต์/คำตอบ” (โดยทั่วไป 100+ ตัวอย่าง) เพื่อสอนโมเดลให้ใช้เสียงแบรนด์เฉพาะ รูปแบบเอาต์พุต (เช่น JSON ที่กำหนดเอง) หรือภาษาเฉพาะโดเมน
  2. การแคชบริบท: สำหรับองค์กรที่ต้องจัดการกับเซตข้อมูลขนาดใหญ่และคงที่ (เช่น ห้องสมุดทางกฎหมายหรือฐานโค้ด) สตูดิโออนุญาตให้ แคชบริบท ซึ่งช่วยให้คุณสามารถ “โหลดล่วงหน้า” ล้านโทเค็นของข้อมูลเข้าไปในหน่วยความจำของโมเดล ลดความหน่วงและต้นทุนสำหรับการปรึกษาที่ตามมา
  3. การกลั่น (Teacher-Student): สิ่งนี้เป็นการเคลื่อนไหวทางสถาปัตยกรรมระดับสูง คุณสามารถใช้โมเดลขนาดใหญ่ (Gemini 2.5 Pro) เพื่อ “สอน” โมเดลที่เล็กกว่าและเร็วกว่า (Gemini 2.0 Flash) ผลลัพธ์คือโมเดลที่เบาที่ทำงานในระดับ “Pro” แต่ทำงานด้วยความเร็วและต้นทุนของ “Flash”

Vertex AI Agent Builder: โรงงานสำหรับการอัตโนมัติ

Vertex AI Agent Builder เป็นเฟรมเวิร์กการออร์เคสตราที่ระดับสูงซึ่งช่วยให้นักพัฒนาสามารถสร้างเอเจนต์เหล่านี้โดยการรวมโมเดลพื้นฐานกับข้อมูลขององค์กรและ API ภายนอก

สถาปัตยกรรมของ “ความจริง”: การยึดและ RAG

อุปสรรคทางเทคนิคหลักที่ขัดขวาง AI ในองค์กรคือ การหลอกลวง เอเจนต์ บิลเดอร์แก้ไขปัญหานี้ผ่านเครื่องมือ การยึด ที่ซับซ้อน

  • การยึดด้วย Google Search: สำหรับการปรึกษาที่ต้องการความรู้ของโลกแบบเรียลไทม์ (เช่น “อัตราดอกเบี้ยจำนองปัจจุบันในนิวยอร์กคืออะไร?”) เอเจนต์สามารถค้นหา Google และดึงข้อเท็จจริงออกมาโดยอ้างอิงแหล่งที่มา
  • Vertex AI Search (RAG-as-a-Service): แทนที่จะสร้างฐานข้อมูลเวกเตอร์ (Pinecone, Weaviate) ด้วยตนเอง นักพัฒนาสามารถใช้ Vertex AI Search เพื่อสร้างดัชนีเอกสารของตนเอง (PDF, HTML, BigQuery) โดยอัตโนมัติ โดยจัดการขั้นตอน “การแบ่งชิ้น”, “การฝัง” และ “การดึง” โดยอัตโนมัติ เพื่อให้แน่ใจว่าเอเจนต์จะตอบตาม “แหล่งที่มาของความจริง” ภายในขององค์กรเท่านั้น
  • Vertex AI RAG Engine: สำหรับการใช้งานแบบกำหนดเองในระดับสูง บริการที่จัดการนี้ช่วยให้การค้นหาที่ผสมผสาน (การรวมผลลัพธ์เวกเตอร์และคีย์เวิร์ด) เพื่อปรับปรุงความแม่นยำได้มากถึง 30% เมื่อเทียบกับเอาต์พุต LLM ทั่วไป

การออร์เคสตราแบบหลายเอเจนต์ (A2A Protocol)

การทำงานขององค์กรขั้นสูงมักต้องการเอเจนต์หลายตัวที่ทำงานร่วมกัน Vertex AI นำเสนอ Protocol เอเจนต์-ถึง-เอเจนต์ (A2A) ซึ่งเป็นมาตรฐานที่เปิดกว้างที่อนุญาตให้:

  • “เอเจนต์สำหรับการเดินทาง” พูดคุยกับ “เอเจนต์ทางการเงิน” เพื่อให้แน่ใจว่าการจองเที่ยวบินอยู่ภายในงบประมาณขององค์กร
  • การทำงานร่วมกัน: เนื่องจากใช้โปรโตคอลที่เปิดกว้าง เอเจนต์ที่สร้างขึ้นใน Vertex AI จึงสามารถสื่อสารกับเอเจนต์ที่สร้างขึ้นในเฟรมเวิร์กอื่นๆ เช่น LangChain หรือ CrewAI

สแต็คของนักพัฒนา: ADK และ Agent Engine

สำหรับกลุ่ม “แพลตฟอร์มเทคนิค” เอเจนต์ บิลเดอร์ มีเส้นทางที่แตกต่างกันสองเส้นทาง:

  1. คอนโซลแบบไม่ต้องเขียนโค้ด: อินเทอร์เฟซแบบลากและวางสำหรับการสร้างต้นแบบอย่างรวดเร็วและการกำหนดค่าสำหรับผู้ใช้งานทางธุรกิจ
  2. ชุดพัฒนาอุปกรณ์ (ADK): ชุดพัฒนาซอฟต์แวร์ Python สำหรับวิศวกร ซึ่งช่วยให้สามารถเขียน “พรอมต์เป็นโค้ด” รวมถึงการบูรณาการกับการควบคุมเวอร์ชันและการนำไปใช้กับ Vertex AI Agent Engine ซึ่งเป็นรันไทม์ที่จัดการซึ่งจัดการความคงอยู่ของเซสชัน การปรับขนาด และการจัดการสถานะโดยอัตโนมัติ

สรุป: จาก “อะไรถ้า” ถึง “อะไรต่อไป”

การเปลี่ยนแปลงจากตัวอย่าง AI ที่น่าประทับใจไปสู่แอปพลิเคชันระดับองค์กรที่พร้อมสำหรับการผลิตมานานแล้วเป็น “หุบเขาตาย” สำหรับโครงการการเปลี่ยนแปลงทางดิจิทัล ในขณะที่เราได้สำรวจ Vertex AI ได้รับการออกแบบมาโดยเฉพาะเพื่อเชื่อมช่องว่างนี้ โดยการรวมช่องว่างที่กระจัดกระจายของข้อมูล โครงสร้างพื้นฐาน และการออร์เคสตราของโมเดล Google Cloud ได้ย้ายการอภิปรายจากพลังของโมเดลภาษาขนาดใหญ่ไปสู่ ความตื่นตัวในการดำเนินงาน ของวงจรชีวิต AI

Kunal Kejriwal เป็นวิศวกรแบ็กเอนด์ที่เชี่ยวชาญด้าน Python, PostgreSQL, Redis และโครงสร้างพื้นฐานคลาวด์บน GCP และ AWS. ด้วยประสบการณ์สามปีในการสร้างและขยายระบบการผลิต เขาเขียนเกี่ยวกับโครงสร้างพื้นฐาน AI, ระบบกระจาย, และสถาปัตยกรรมที่อยู่เบื้องหลังการปรับใช้งานแมชชีนเลิร์นนิง