Skylark Embedding Vision

Skylark Embedding Vision
ByteDance · Embeddings
POST /v1/embeddings

Multimodal embedding that fuses text, images, and video into one 1024 or 2048 dimension vector for cross-modal search and retrieval.

At a glance

FieldValue
Model idskylark-embedding-vision
Model release date2025-06-28
Input modalitiesText, Image, Video
Output modalitiesEmbedding
Context window8K
Weight precision-
RegionMalaysia
Featuresmultimodal, fused vectors
Native inferenceNo
NewNo
Supported endpointsPOST /v1/embeddings
Alternate model idsbyteplus/skylark-embedding-vision, skylark-embedding-vision-250615, doubao-embedding-vision

Pricing

ChargeSpecRate
Text inputper 1M tokens$0.25
Image / video inputper 1M tokens$0.65

Example request

$curl https://api.empiriolabs.ai/v1/embeddings \
> -H 'Authorization: Bearer $EMPIRIOLABS_API_KEY' \
> -H 'Content-Type: application/json' \
> -d '{"model": "skylark-embedding-vision", "input": [{"type":"text","text":"Embed me."},{"type":"image","url":"https://media.empiriolabs.ai/example.jpg"}]}'

Parameters

ParameterTypeRequiredDefaultDescription
inputstringyes-Text to embed, an array of up to 16 strings (one embedding each), or an array of text, image_url, and video_url parts fused into one embedding.
dimensionsenumno"2048"Output vector dimensionality. · Allowed: 1024, 2048
encoding_formatenumno"float"Embedding encoding of the response. · Allowed: float, base64
instructionsstringno-Optional retrieval instruction that conditions the embedding, such as a query-side or corpus-side template.

Notes

Output

  • One fused vector per request across all input items (text, image, and video combine into a single embedding). Choose 1024 or 2048 dimensions.
  • An array of plain strings returns one embedding per string, up to 16 per request.

Per-input limits

  • Text: up to 8,000 tokens per item.
  • Image: JPEG, PNG, WEBP, BMP, or TIFF, sides over 14 px, up to 36MP.
  • Video: MP4, AVI, or MOV, up to 50 MB; audio tracks are ignored.

Retrieval

  • An optional instructions field conditions the embedding for the query or corpus side. Apply L2 normalization before cosine or dot-product comparison.

Machine-readable schema: GET https://api.empiriolabs.ai/v1/models/skylark-embedding-vision.