Alibaba เปิดตัว Qwen2.5-VL โมเดลวิเคราะห์และดึงข้อมูลจากรูปภาพ รวมทั้งเป็น Agent บนอุปกรณ์

By: arjin

on 28 January 2025 - 07:52 Tags:

Topics:

Alibaba Cloud

LLM

Qwen

Alibaba เปิดตัวโมเดลปัญญาประดิษฐ์ใหม่ในตระกูล Qwen2.5 ชื่อว่า Qwen2.5-VL โดย VL ย่อมาจาก Vision Language เป็นรุ่นถัดจาก Qwen2-VL มีความสามารถเข้าใจวิดีโอ รูปภาพ ข้อความ และเป็น Agentic ที่ทำงานแทนได้ด้วย

ตัวอย่างความสามารถที่พิเศษขึ้นของ Qwen2.5-VL เช่น การรู้จักภาพสถานที่ ฉากภาพยนตร์ รายการทีวี สินค้า, สามารถระบุลักษณะวัตถุในภาพตามเงื่อนไข และส่งออกเป็นไฟล์ JSON ได้, ระบุตัวอักษรที่หลากหลายแบบในภาพเดียวได้, สามารถส่งออกไฟล์เอกสารออกมาเป็นฟอร์แมตที่ต้องการได้, สามารถดึงข้อมูลจากวิดีโอออกมาได้ และทำหน้าที่เป็น Agent รันบนคอมพิวเตอร์หรือสมาร์ทโฟนได้

Qwen2.5-VL มี 3 โมเดลย่อยแตกต่างที่ขนาดพารามิเตอร์ได้แก่ 3B, 7B และขนาดใหญ่ที่สุด 72B ดูข้อมูลเพิ่มเติมได้ที่ Hugging Face

ที่มา: Alibaba

No Description

ความสามารถของ 72B เทียบกับ Gemini 2 Flash ชนะหลายรายการ

No Description

โมเดลเล็ก 7B ก็สูงกว่า GPT-4o Mini ในหลายหัวข้อ

No Description