Skylark Embedding Vision

ByteDance · Embeddings
POST /v1/embeddingsMultimodal embedding that fuses text, images, and video into one 1024 or 2048 dimension vector for cross-modal search and retrieval.
At a glance
Pricing
Example request
Parameters
Notes
Output
- One fused vector per request across all input items (text, image, and video combine into a single embedding). Choose 1024 or 2048 dimensions.
- An array of plain strings returns one embedding per string, up to 16 per request.
Per-input limits
- Text: up to 8,000 tokens per item.
- Image: JPEG, PNG, WEBP, BMP, or TIFF, sides over 14 px, up to 36MP.
- Video: MP4, AVI, or MOV, up to 50 MB; audio tracks are ignored.
Retrieval
- An optional instructions field conditions the embedding for the query or corpus side. Apply L2 normalization before cosine or dot-product comparison.
Machine-readable schema: GET https://api.empiriolabs.ai/v1/models/skylark-embedding-vision.
