คำตอบสั้นๆ
โมเดลภาษาทำได้อย่างเดียวคือเดา token ถัดไป ภาพ เสียง และวิดีโอที่ได้จาก AI จึงมาจากหนึ่งในสามวิธี คือส่ง prompt ต่อให้โมเดลภาพ เสียง หรือวิดีโอที่แยกกัน ให้โมเดลเดาสื่อเองเป็น token แล้วถอดกลับเป็นภาพหรือเสียง หรือใช้ diffusion ค่อย ๆ ลบ noise จนเป็นภาพหรือคลิป วิดีโอแพงที่สุด เพราะทุกวินาทีคูณงานขึ้นไปอีก
AI สร้างภาพ เสียง และวิดีโอได้ยังไง
โมเดลภาษาอย่าง ChatGPT, Gemini หรือ Claude ทำได้อย่างเดียวคือเดาชิ้นข้อความถัดไปที่เรียกว่า token ทีละชิ้น ภาพ เสียง และวิดีโอทุกชิ้นที่ได้จากผลิตภัณฑ์ AI จึงต้องมาจากหนึ่งในสามวิธีที่สร้างขึ้นรอบข้อจำกัดนี้
วิธีแรกคือส่งต่อ โมเดลภาษาเขียน prompt ละเอียดแล้วเรียกโมเดลภาพ เสียง หรือวิดีโอที่แยกกันให้ทำงาน วิธีที่สองคือแปลงสื่อเป็น token ให้ภาพและเสียงกลายเป็นรหัสชุดหนึ่งที่โมเดลเดาต่อได้เหมือนคำ วิธีที่สามคือ diffusion เริ่มจากสัญญาณรบกวนแบบสุ่มแล้วค่อย ๆ ขัดให้เป็นภาพ ผังด้านล่างวางทั้งสามวิธีเทียบกันให้เห็น
ผลิตภัณฑ์จริงมักผสมกัน เช่น โมเดลแชตวางแผนและเขียน prompt แล้วให้โมเดล diffusion วาด หรือโมเดลที่สร้างภาพเองก็อาจใช้ตัวถอดรหัสแบบ diffusion ขัดภาพรอบสุดท้าย
- คุณพิมพ์ว่า ทำโปสเตอร์โปรสงกรานต์ให้หน่อย
- โมเดลภาษาเขียนคำสั่งแบบละเอียดให้
- โมเดลภาพ เสียง หรือวิดีโอเฉพาะทางสร้างงานออกมา
- ผลลัพธ์ส่งกลับมาในแชต
- ตัวเข้ารหัสแปลงภาพหรือเสียงเป็นชุดรหัส
- ทรานส์ฟอร์เมอร์ตัวเดิมทายรหัสถัดไปทีละตัว เหมือนทายคำ
- ตัวถอดรหัสแปลงรหัสกลับเป็นภาพหรือเสียง
- เริ่มจาก noise สุ่มล้วนๆ
- ลบ noise ออกทีละนิด 20 ถึง 50 รอบ โดยมีคำสั่งเป็นตัวนำทาง
- ถอดรหัสงานที่สะอาดแล้วเป็นความละเอียดเต็ม
การส่งต่อให้โมเดลเฉพาะทาง (hand-off) คืออะไร
Hand-off คือการที่โมเดลภาษาไม่ได้สร้างภาพเอง แต่เขียนคำสั่งละเอียดแล้วเรียกเครื่องมือหรือโมเดลอีกตัวมาสร้างให้ เช่น คุณพิมพ์ว่า "ทำโปสเตอร์โปรสงกรานต์ให้หน่อย" โมเดลภาษาจะแปลงเป็น prompt ยาวที่ระบุสี องค์ประกอบ และสไตล์ แล้วส่งให้โมเดลภาพวาด ผลลัพธ์จึงค่อยกลับมาโชว์ในแชต
ตัวอย่างที่คนรู้จักคือ ChatGPT ที่เรียก DALL·E 3 ในปี 2566 และเครื่องมือแบบ agent ส่วนใหญ่ในวันนี้ก็ยังทำแบบนี้ ข้อดีคือเปลี่ยนไปใช้โมเดลที่เก่งที่สุดของแต่ละงานได้ง่าย ทดลองถูก และคุมได้ว่าส่งอะไรไปที่ไหน
ข้อเสียคือโมเดลภาษาไม่เคยเห็นภาพที่ได้ออกมาจริง ๆ พอสั่งแก้ต่อ เช่น "ภาพเดิมนะ แค่ขยับโลโก้ไปซ้าย" โมเดลภาพมักวาดใหม่ทั้งภาพ รายละเอียดที่ชอบอยู่แล้วจึงเพี้ยนไปด้วย
AI เปลี่ยนภาพและเสียงเป็น token ได้ยังไง
AI เปลี่ยนภาพและเสียงเป็น token ด้วยตัวบีบอัดที่เรียนรู้มา ฝั่ง encoder ย่อสื่อให้เหลือรหัสสั้น ๆ ชุดหนึ่งที่เลือกจากสมุดรหัส (codebook) ที่ตายตัว ฝั่ง decoder สร้างสื่อกลับจากรหัสเหล่านั้น เมื่อสื่อกลายเป็นรายการรหัสแล้ว transformer ตัวเดียวกับที่เดาคำก็เดารหัสภาพหรือเสียงต่อได้ทันที
เสียงใช้ตัวบีบอัดที่เรียกว่า neural audio codec เช่น SoundStream ของ Google และ EnCodec ของ Meta ทั้งสองแบ่งเสียงเป็นช่วงสั้น ๆ แล้วให้รหัสซ้อนกันหลายชั้นต่อช่วง ชั้นแรกเก็บภาพรวม ชั้นถัดไปเก็บรายละเอียดที่ยังขาด เทคนิคนี้เรียกว่า residual vector quantization หรือ RVQ ตัวเลขจริงของ EnCodec ที่ 6 kbps คือ 75 ช่วงต่อวินาที ช่วงละ 8 รหัส รวมเป็น 600 รหัสต่อเสียงหนึ่งวินาที
งานวิจัย AudioLM ของ Google ใช้รหัสสองแบบ แบบแรกเป็น semantic token เก็บว่าพูดอะไร แบบที่สองเป็น acoustic token เก็บว่าเสียงเป็นแบบไหน น้ำเสียงเป็นยังไง โมเดลเดาแบบแรกก่อนแล้วค่อยเติมแบบที่สอง ดูผังด้านล่างว่าภาพและเสียงเดินทางจาก encoder ผ่าน transformer ไปถึง decoder ยังไง
- เก่งเรื่องตัวหนังสือในภาพและคำสั่งยาว ๆ เพราะ prompt กับภาพอยู่ในลำดับเดียวกัน โมเดลอ่านทั้งสองอย่างไปพร้อมกัน
- เก่งเรื่องสั่งแก้ต่อ เพราะโมเดลเห็นรหัสภาพที่ตัวเองสร้างไว้ จึงแก้เฉพาะจุดโดยไม่ต้องวาดใหม่ทั้งภาพ
- ช้ากว่า เพราะต้องเดาทีละรหัส และภาพหนึ่งภาพใช้รหัสหลักพัน ขณะที่คำตอบข้อความใช้แค่หลักร้อย
- OpenAI อธิบายว่าการสร้างภาพของ GPT-4o ในปี 2568 เป็นแบบ native ที่เดาทีละส่วน (autoregressive) แต่ไม่ได้เปิดเผยสถาปัตยกรรม บทวิเคราะห์จากภายนอกคาดว่าโมเดลเดา latent ของภาพแล้วใช้ตัวถอดรหัสแบบ diffusion ขัดรอบสุดท้าย ข้อนี้เป็นการคาดการณ์ ไม่ใช่ข้อมูลจาก OpenAI
Diffusion คืออะไร สร้างภาพจาก noise ได้ยังไง
Diffusion คือการสร้างภาพด้วยการเริ่มจากสัญญาณรบกวนแบบสุ่ม (noise) ล้วน ๆ แล้วค่อย ๆ ลบ noise ออกทีละนิด 20 ถึง 50 รอบ โดยมี prompt คอยบอกทิศทาง จนเหลือภาพที่ต้องการ ตอนฝึก โมเดลเห็นภาพจริงที่ผสม noise ไว้หลายระดับ และเรียนรู้ว่าส่วนไหนคือ noise ตอนใช้งานจึงทำย้อนกลับได้
โมเดลรุ่นใหม่อย่าง Stable Diffusion 3 ใช้วิธีที่เรียกว่า rectified flow คือวาง noise กับภาพไว้บนเส้นตรงเส้นเดียว แล้วให้โมเดลเรียนรู้ทิศทางเดินจากฝั่งหนึ่งไปอีกฝั่ง เส้นทางที่ตรงทำให้ใช้รอบน้อยลงได้
เพื่อประหยัดแรงคำนวณ งานนี้ไม่ได้ทำบนภาพขนาดเต็ม ตัวบีบอัดจะย่อภาพเป็น latent ที่เล็กกว่าเดิม 8 เท่าต่อด้านใน Stable Diffusion การลบ noise เกิดในพื้นที่เล็กนั้น แล้ว decoder ค่อยขยายกลับเป็นภาพเต็มตอนท้าย
โมเดล diffusion ไม่ได้เข้าใจภาษาเอง ต้องอาศัย text encoder แปลง prompt เป็นตัวเลขที่ใช้บอกทิศทาง Stable Diffusion 3 ใช้ถึงสามตัว คือ CLIP-L, CLIP-G และ T5-XXL ผังด้านล่างไล่ให้ดูว่าภาพค่อย ๆ ชัดขึ้นจาก noise ยังไง
ตอนสร้างจริง โมเดลเดินจากซ้ายไปขวา ลบ noise ออกทีละช่วง โดยมีข้อความคำสั่งเป็นตัวบอกทิศ
AI สร้างวิดีโอได้ยังไง Sora กับ Veo ต่างกันตรงไหน
AI สร้างวิดีโอด้วย diffusion ที่ทำพร้อมกันทั้งในภาพและในเวลา รายงานเทคนิคของ Sora จาก OpenAI อธิบายไว้ชัดที่สุด คือบีบวิดีโอเป็น latent ก่อน ตัดเป็นชิ้นเล็ก ๆ ที่เรียกว่า spacetime patch ซึ่งกินพื้นที่ไม่กี่พิกเซลและยาวไม่กี่เฟรม แล้วให้ diffusion transformer ลบ noise ของทุกชิ้นไปพร้อมกัน
เพราะทุกชิ้นมองเห็นชิ้นอื่นได้หมด ใบหน้าในเฟรมแรกจึงยังเป็นใบหน้าเดิมในเฟรมที่ 200 ความต่อเนื่องแบบนี้คือส่วนที่ยากที่สุด และปริมาณการคำนวณโตตามความกว้าง ความสูง และความยาวของคลิป วิดีโอจึงแพงที่สุดในบรรดาสื่อทั้งหมด ผังด้านล่างแสดงว่าวิดีโอแบ่งเป็นก้อนเล็ก ๆ ทั้งในภาพและในเวลายังไง
Veo 3 ของ Google เพิ่มเสียงเข้ามาในการสร้างรอบเดียวกัน ทั้งบทพูด เสียงประกอบ และเสียงบรรยากาศ ปากกับเสียงพูดและจังหวะเดินกับเสียงฝีเท้าจึงตรงกัน model card ของ Veo 3 ระบุว่าเป็น latent diffusion ที่ลบ noise ของ latent ภาพและ latent เสียงไปพร้อมกัน แต่ไม่ได้ลงรายละเอียดเท่ารายงานของ Sora
ส่วนต่างในทางปฏิบัติตอนนี้คือ Sora ปิดไปแล้ว OpenAI ปิดแอปและเว็บ Sora เมื่อ 26 เมษายน 2569 และปิด Sora API วันที่ 24 กันยายน 2569 ถ้าจะเริ่มทำวิดีโอวันนี้ จึงควรดูตัวเลือกอย่าง Veo 3.1 หรือ Runway แทน
AI สร้างเสียงพูดและเพลงยังไง
เสียงพูดส่วนใหญ่ใช้วิธีแปลงเป็น token ข้อความหรือเสียงตัวอย่างเข้าไป โมเดลเดารหัสของ audio codec แล้ว decoder แปลงรหัสกลับเป็นคลื่นเสียง งานวิจัย VALL-E ของ Microsoft ใช้รหัส EnCodec แบบนี้ และเลียนเสียงคนจากตัวอย่างสั้น ๆ ได้
โหมดคุยด้วยเสียงแบบเรียลไทม์ในแอปแชตทำงานแบบ speech-to-speech คือรับเสียงเป็น token แล้วตอบเป็น token เสียงเลย ไม่ต้องแปลงเป็นข้อความก่อน จึงตอบได้เร็วและเก็บน้ำเสียงได้ ส่วนที่ยากคือจังหวะพูดกับอารมณ์ที่ต้องเป็นธรรมชาติ โดยที่ยังตอบกลับเร็ว
เพลงยากกว่าเสียงพูด เพราะต้องคุมโครงสร้างยาวหลายนาที ทั้งท่อนร้อง ท่อนฮุก และการกลับมาของทำนอง งานวิจัยอย่าง MusicLM ของ Google ใช้ token ส่วนแอปทำเพลงเชิงพาณิชย์ส่วนใหญ่ไม่เปิดเผยสถาปัตยกรรม จึงบอกไม่ได้แน่ว่าใช้ token, diffusion หรือผสมกัน
ภาพ เสียง เพลง และวิดีโอ แต่ละอย่างใช้วิธีไหน ยากตรงไหน
ภาพใช้ได้ทั้ง diffusion และ token เสียงพูดใช้ token เป็นหลัก เพลงยังไม่มีใครเปิดเผยมากนัก และวิดีโอใช้ diffusion transformer ตารางนี้สรุปให้เทียบกันในที่เดียว
| สื่อ | วิธีหลักตอนนี้ | ตัวอย่าง | ส่วนที่ยากที่สุด |
|---|---|---|---|
| ภาพ | Diffusion หรือ token ภาพในโมเดลภาษา | Stable Diffusion 3, การสร้างภาพของ GPT-4o, โมเดลภาพของ Gemini | มือ ตัวหนังสือในภาพ และการจัดวางที่ต้องเป๊ะ |
| เสียงพูด | Token ของ audio codec แล้วถอดรหัสกลับ | VALL-E, AudioLM, โหมดคุยด้วยเสียงแบบเรียลไทม์ | จังหวะและอารมณ์ที่เป็นธรรมชาติ โดยไม่หน่วง |
| เพลง | Token หรือ diffusion (ผู้ให้บริการส่วนใหญ่ไม่เปิดเผย) | MusicLM, แอปทำเพลงเชิงพาณิชย์ | โครงเพลงยาวหลายนาที ทั้งท่อนร้อง ท่อนฮุก และการกลับมาของทำนอง |
| วิดีโอ | Diffusion transformer บน spacetime patch | Sora (ปิดแล้ว), Veo 3 และ 3.1 | หน้าคนและฟิสิกส์ที่คงเดิมทุกเฟรม และค่าใช้จ่าย |
เครื่องมือ AI สร้างภาพ วิดีโอ และเสียงตัวไหนดี ราคาเท่าไหร่
เครื่องมือที่คนใช้กันมีสองแบบ แบบแรกคิดเงินตามการใช้ผ่าน API เหมาะกับการต่อเข้าระบบ แบบที่สองเป็นแพ็กเกจรายเดือนที่ใช้ผ่านหน้าเว็บ เหมาะกับทีมการตลาดที่ทำงานเอง ตารางนี้ใส่เฉพาะเครื่องมือที่เราตรวจราคาและเงื่อนไขการใช้เชิงพาณิชย์ได้จากหน้าของผู้ให้บริการเองเมื่อ 23 กันยายน 2569 ราคาเป็นดอลลาร์สหรัฐตามที่ประกาศ ยังไม่รวมภาษี
เรื่องสิทธิ์ ให้เช็กสามข้อก่อนใช้งานจริง ข้อแรก แพ็กเกจฟรีส่วนใหญ่ห้ามใช้เชิงพาณิชย์ ข้อสอง บางเจ้ามีเงื่อนไขตามขนาดธุรกิจ เช่น Midjourney กำหนดให้บริษัทที่มีรายได้เกิน 1 ล้านดอลลาร์ต่อปีใช้แพ็กเกจ Pro หรือ Mega ข้อสาม ทุกเจ้าให้ผู้ใช้รับผิดชอบว่าสิ่งที่ใส่เข้าไปและผลงานที่ได้ไม่ละเมิดสิทธิ์ใคร เงื่อนไขเปลี่ยนได้ ควรเปิดหน้าข้อตกลงล่าสุดอ่านเองก่อนจ่ายเงิน
| เครื่องมือ | ใช้ทำอะไร | ราคาที่ประกาศ (USD) | สิทธิ์ใช้เชิงพาณิชย์ |
|---|---|---|---|
| OpenAI GPT Image 2 (API) | ภาพ | ภาพ 1024×1024 ราว 0.006 ดอลลาร์ที่คุณภาพ low, 0.053 ที่ medium และ 0.211 ที่ high | ข้อตกลงบริการของ OpenAI ระบุว่าลูกค้าเป็นเจ้าของผลงาน |
| Google Gemini 3.1 Flash Image (API) | ภาพ | 0.067 ดอลลาร์ต่อภาพ 1K และ 0.151 ดอลลาร์ต่อภาพ 4K ในแพ็กเกจแบบจ่ายเงิน | Google ไม่อ้างสิทธิ์ความเป็นเจ้าของผลงาน แต่ข้อมูลที่ส่งผ่านแพ็กเกจฟรีนำไปใช้พัฒนาผลิตภัณฑ์ได้ |
| Midjourney | ภาพ และวิดีโอสั้น | Basic 10, Standard 30, Pro 60, Mega 120 ดอลลาร์ต่อเดือน จ่ายรายปีลด 20% | ใช้เชิงพาณิชย์ได้ทุกแพ็กเกจ บริษัทรายได้เกิน 1 ล้านดอลลาร์ต่อปีต้องใช้ Pro หรือ Mega และโหมดซ่อนผลงาน (Stealth) มีเฉพาะสองแพ็กเกจนี้ |
| Google Veo 3.1 (API) | วิดีโอพร้อมเสียง | ต่อวินาที: Standard 0.40 ดอลลาร์ (720p และ 1080p), Fast 0.12 ดอลลาร์ (1080p), Lite 0.08 ดอลลาร์ (1080p) | ใช้ข้อตกลงเดียวกับ Gemini API |
| Runway | วิดีโอ และภาพ | Standard 15 ดอลลาร์ต่อเดือน (625 เครดิต ราว 52 วินาทีของ Gen-4.5), Pro 35 ดอลลาร์ (2,250 เครดิต), Max 95 ดอลลาร์ จ่ายรายปีถูกลง | ข้อตกลงระบุว่าไม่จำกัดการใช้ผลงานเชิงพาณิชย์ ถ้าทำตามข้อตกลง แพ็กเกจฟรีมีลายน้ำ |
| ElevenLabs | เสียงพูด เสียงประกอบ และเพลง | Starter 6, Creator 22, Pro 99 ดอลลาร์ต่อเดือน ได้ 30,000, 121,000 และ 600,000 เครดิต เสียงอ่านข้อความใช้ราว 1 เครดิตต่อตัวอักษร | สิทธิ์เชิงพาณิชย์เริ่มที่ Starter แพ็กเกจฟรีไม่มี |
| Suno | เพลง | Pro 8 ดอลลาร์ต่อเดือน (ดาวน์โหลด 20 เพลง), Premier 24 ดอลลาร์ต่อเดือน (60 เพลง) เมื่อจ่ายรายปี | ใช้เชิงพาณิชย์ได้เฉพาะ Pro และ Premier แพ็กเกจฟรีใช้ได้แค่ส่วนตัว |
ธุรกิจแบบไหนควรใช้เครื่องมือไหน ดูจากสี่ตัวอย่าง
สี่ตัวอย่างนี้เป็นสถานการณ์สมมติที่รวมมาจากโจทย์ที่ธุรกิจไทยเจอบ่อย ไม่ใช่ลูกค้าจริงรายใด ตัวเลขคำนวณจากราคาในตารางก่อนหน้า และเผื่อการสร้างซ้ำไว้แล้ว เพราะงานจริงแทบไม่มีครั้งไหนได้ภาพที่ใช้ได้ตั้งแต่รอบแรก
| ตัวอย่างสมมติ | วิธีและเครื่องมือที่เข้ากัน | ค่าใช้จ่ายคร่าว ๆ |
|---|---|---|
| คลินิกความงามทำภาพโปรโมชันลงโซเชียล 30 ภาพต่อเดือน | Diffusion หรือ token ผ่าน Midjourney หรือ GPT Image 2 ถ้าต้องมีตัวหนังสือภาษาไทยในภาพ ให้ทดสอบตัวที่สร้างภาพแบบ native ก่อน และไม่ควรสร้างภาพที่ดูเหมือนผลการรักษาจริงของคนไข้ | GPT Image 2 คุณภาพ medium สร้าง 90 ภาพเพื่อเลือก 30 ราว 5 ดอลลาร์ หรือ Midjourney Standard 30 ดอลลาร์ต่อเดือน (ถ้ารายได้เกิน 1 ล้านดอลลาร์ต่อปีต้องเป็น Pro 60 ดอลลาร์) |
| ร้านออนไลน์ทำคลิปสินค้า 20 คลิป คลิปละ 8 วินาที | Diffusion transformer ผ่าน Veo 3.1 หรือ Runway เริ่มจากภาพสินค้าจริงแล้วให้ AI ขยับกล้อง ดีกว่าให้ AI วาดสินค้าเอง | Veo 3.1 Fast ที่ 1080p 160 วินาทีเท่ากับ 19.20 ดอลลาร์ต่อรอบ เผื่อสร้างสามรอบราว 58 ดอลลาร์ หรือ Runway Pro 35 ดอลลาร์ต่อเดือน ได้ราว 187 วินาทีของ Gen-4.5 |
| ผู้ช่วยตอบลูกค้าทาง LINE ที่ตอบเป็นเสียงได้ด้วย | Hand-off ให้โมเดลภาษาเขียนคำตอบ แล้วส่งให้ ElevenLabs อ่านออกเสียง ถ้าต้องคุยสดทางโทรศัพท์ ดูโหมด speech-to-speech ที่ใช้ token เสียง | ElevenLabs Creator 22 ดอลลาร์ต่อเดือน อ่านข้อความได้ราว 121,000 ตัวอักษร ค่าโมเดลภาษาคิดแยกต่างหาก |
| วิดีโออบรมพนักงานใหม่ยาว 10 นาทีพร้อมเสียงบรรยาย | ถ่ายหน้าจอหรือสไลด์จริง ใช้ ElevenLabs บรรยาย และแทรกคลิปสั้นจาก Veo 3.1 Lite เฉพาะฉากที่ถ่ายเองไม่ได้ | ElevenLabs Creator 22 ดอลลาร์ต่อเดือน บวกคลิปแทรก 10 คลิป คลิปละ 6 วินาทีที่ 1080p ราว 4.80 ดอลลาร์ต่อรอบ |
ธุรกิจควรคิดเรื่องอะไรก่อนใช้ AI สร้างสื่อ
ค่าใช้จ่ายโตตามจำนวน token หรือรอบคำนวณ คำตอบข้อความใช้ไม่กี่ร้อย token ภาพหนึ่งภาพใช้รหัสหลักพันหรือลบ noise หลายสิบรอบ ส่วนวิดีโอคืองานทั้งหมดนั้นคูณด้วยจำนวนวินาที ให้วางงบวิดีโอไว้มากที่สุด และคิดราคาต่อชิ้นที่ใช้ได้จริง ไม่ใช่ราคาต่อครั้งที่กดสร้าง
ถ้าจะต่อ AI สร้างสื่อเข้ากับผลิตภัณฑ์หรือระบบของคุณ การให้โมเดลภาษาวางแผนแล้วเรียกโมเดลเฉพาะทาง (hand-off) เป็นจุดเริ่มที่ใช้งานได้จริงที่สุด เปลี่ยนโมเดลได้ง่าย ทดลองถูก และคุมง่าย แต่ถ้างานหลักคือการสั่งแก้ภาพเดิมซ้ำ ๆ โมเดลที่สร้างภาพเองแบบ native จะเก็บส่วนที่ไม่ได้สั่งแก้ไว้ได้ดีกว่า
ก่อนใช้กับงานที่ลูกค้าเห็น ให้เช็กความเสี่ยงเหล่านี้
- ความสม่ำเสมอของแบรนด์: สี โลโก้ และหน้าตาสินค้ามักเพี้ยนระหว่างภาพ ต้องมีคนตรวจก่อนเผยแพร่ทุกชิ้น
- สิทธิ์ในหน้าและเสียงของคน: ใบหน้าและเสียงที่ระบุตัวคนได้เป็นข้อมูลส่วนบุคคลภายใต้ PDPA การเลียนเสียงพนักงานหรือใช้รูปลูกค้าต้องมีเหตุผลรองรับตามกฎหมาย และควรได้รับความยินยอมเป็นลายลักษณ์อักษร
- บอกลูกค้าว่างานไหนใช้ AI: YouTube และ TikTok มีกติกาให้ติดป้ายเนื้อหาที่สร้างด้วย AI ให้ดูเหมือนจริง และการบอกตรง ๆ ก็ช่วยรักษาความเชื่อใจของลูกค้า
- งานโฆษณาบางประเภท เช่น สถานพยาบาล อาหาร และยา มีกติกาโฆษณาของตัวเอง ภาพที่ AI สร้างก็ต้องทำตามเหมือนภาพถ่ายจริง
- ข้อมูลที่ส่งออกไป: รูปสินค้าที่ยังไม่เปิดตัวหรือเสียงของลูกค้าไม่ควรใส่ลงแพ็กเกจฟรีที่ผู้ให้บริการนำข้อมูลไปพัฒนาผลิตภัณฑ์ได้
SyncEdge ช่วยเรื่อง AI สร้างสื่อได้แค่ไหน
เราเริ่มจากงานจริงของทีมคุณ ไม่ใช่จากรายการเครื่องมือ ดูว่างานภาพ เสียง หรือวิดีโอชิ้นไหนกินเวลาหรือเงินมากที่สุด แล้วประเมินว่า AI คุ้มที่จะเข้าไปช่วยตรงนั้นหรือไม่ ถ้าคำตอบคือจ้างช่างภาพหรือปรับขั้นตอนทำงานถูกกว่า เราก็บอกตรง ๆ
ถ้าคุ้ม เราอบรมทีมด้วยงานและข้อมูลของคุณเอง แล้ววางกติกาให้สอดคล้อง PDPA ว่ารูป เสียง หรือข้อมูลลูกค้าแบบไหนใส่ลงเครื่องมือภายนอกได้ แบบไหนห้าม จบงานคุณได้เอกสารสรุปว่าใช้ AI ตรงไหน ไม่ใช้ตรงไหน และขั้นตอนถัดไป งานนี้จัดที่บริษัทหรือออนไลน์ก็ได้ และคิดราคาเหมาจ่ายหลังสรุปขอบเขต
ก่อนจ่ายเงินให้เครื่องมือ AI สร้างสื่อ เช็กข้อเหล่านี้
- แพ็กเกจที่จะซื้อให้สิทธิ์ใช้เชิงพาณิชย์หรือเปล่า และมีเงื่อนไขตามรายได้ของบริษัทไหม
- ผลงานเป็นสาธารณะโดยค่าเริ่มต้นหรือเปล่า ต้องใช้แพ็กเกจไหนถึงซ่อนได้
- ผู้ให้บริการเอาข้อมูลที่คุณใส่เข้าไปไปพัฒนาผลิตภัณฑ์ของตัวเองหรือเปล่า
- ลองกับงานจริงของคุณแล้วหรือยัง รวมถึงตัวหนังสือและเสียงภาษาไทย
- คิดค่าใช้จ่ายต่อชิ้นที่ใช้ได้จริง รวมรอบที่ต้องสร้างซ้ำแล้วหรือยัง
- เครดิตรายเดือนพอกับปริมาณงาน และเครดิตที่เหลือยกไปเดือนหน้าได้ไหม
- ได้รับความยินยอมจากเจ้าของหน้าหรือเสียงที่นำมาใช้แล้วหรือยัง
- ใครเป็นคนตรวจงานก่อนเผยแพร่ และตรวจเรื่องอะไรบ้าง
คำถามที่พบบ่อย
AI สร้างภาพทำงานยังไง
เครื่องมือส่วนใหญ่ใช้ diffusion คือเริ่มจาก noise แบบสุ่มแล้วค่อย ๆ ลบ noise ออกหลายสิบรอบ โดยมี prompt บอกทิศทาง จนได้ภาพที่ต้องการ อีกแบบคือโมเดลภาษาเดารหัสภาพทีละชิ้นเหมือนเดาคำ แล้วถอดรหัสกลับเป็นพิกเซล แบบหลังเก่งเรื่องตัวหนังสือในภาพและการสั่งแก้ แต่ช้ากว่า
Diffusion คืออะไร
Diffusion คือวิธีสร้างภาพหรือวิดีโอด้วยการลบ noise ออกทีละขั้น ตอนฝึก โมเดลเห็นภาพจริงที่ผสม noise หลายระดับและเรียนรู้ว่าส่วนไหนคือ noise ตอนใช้งานจึงเริ่มจาก noise ล้วนแล้วเดินย้อนกลับจนเป็นภาพ โมเดลอย่าง Stable Diffusion, Veo และ Sora ใช้หลักการนี้
Sora กับ Veo ต่างกันยังไง
ทั้งสองสร้างวิดีโอด้วย diffusion บนชิ้นส่วนที่กินทั้งภาพและเวลา Sora มีรายงานเทคนิคที่อธิบายวิธีนี้ละเอียดที่สุด ส่วน Veo 3 เพิ่มเสียงพูดและเสียงประกอบในรอบเดียวกับภาพ ความต่างที่สำคัญตอนนี้คือ OpenAI ปิดแอป Sora ไปเมื่อเมษายน 2569 และปิด Sora API วันที่ 24 กันยายน 2569 ส่วน Veo 3.1 ยังเปิดให้ใช้ผ่าน Gemini API
AI สร้างวิดีโอราคาเท่าไหร่
คิดตามวินาทีเป็นหลัก ณ 23 กันยายน 2569 Google Veo 3.1 ผ่าน API ราคา 0.08 ถึง 0.40 ดอลลาร์ต่อวินาทีที่ 1080p พร้อมเสียง ขึ้นกับรุ่น Lite, Fast หรือ Standard ส่วน Runway เริ่มที่ 15 ดอลลาร์ต่อเดือนสำหรับเครดิตราว 52 วินาทีของ Gen-4.5 อย่าลืมเผื่อค่าสร้างซ้ำ เพราะคลิปที่ใช้ได้มักไม่ได้มาจากรอบแรก
ใช้ภาพหรือเสียงจาก AI ในงานเชิงพาณิชย์ได้ไหม
ได้ในแพ็กเกจที่อนุญาต แต่เงื่อนไขต่างกันไปตามผู้ให้บริการ แพ็กเกจฟรีของ ElevenLabs และ Suno ไม่ให้สิทธิ์เชิงพาณิชย์ Midjourney ให้บริษัทรายได้เกิน 1 ล้านดอลลาร์ต่อปีใช้ Pro หรือ Mega และทุกเจ้าให้ผู้ใช้รับผิดชอบเองถ้าผลงานไปละเมิดสิทธิ์ใคร ควรอ่านข้อตกลงล่าสุดก่อนใช้งานจริง
เลียนเสียงหรือใช้หน้าพนักงานกับ AI ผิด PDPA ไหม
ใบหน้าและเสียงที่ระบุตัวคนได้เป็นข้อมูลส่วนบุคคลภายใต้ PDPA การนำไปสร้างเสียงหรือภาพด้วย AI จึงต้องมีเหตุผลรองรับตามกฎหมาย ทางที่ปลอดภัยคือขอความยินยอมเป็นลายลักษณ์อักษร บอกให้ชัดว่าจะใช้ทำอะไรและใช้ถึงเมื่อไหร่ และเลือกผู้ให้บริการที่ไม่นำข้อมูลไปพัฒนาโมเดล กรณีที่ซับซ้อนควรปรึกษานักกฎหมาย