Velocidad de fotogramas y tiempo

Velocidad de fotogramas (fps)

Cuántas imágenes por segundo contiene el vídeo. Valores comunes: 24 (cine), 25 (emisión PAL), 30 (la mayoría de los teléfonos y vídeos web), 50 y 60 (deportes, juegos, movimiento suave), 120 y 240 (captura en cámara lenta).

Por qué es importante aquí: decide cuántos cuadros existen para extraer y determina qué significa "paso de un cuadro". Configura una herramienta de pasos a la velocidad de fotogramas incorrecta y verás la misma imagen dos veces o saltarás fotogramas silenciosamente.

Duración del fotograma

El recíproco de la velocidad de fotogramas: cuánto tiempo permanece cada fotograma en la pantalla. A 30 fps, 33,3 ms; a 60 fps, 16,7 ms; a 24 fps, 41,7 ms.

Por qué es importante: este es el límite de precisión. Si el momento que desea dura 10 ms y el metraje es de 30 fps, es posible que se encuentre entre dos fotogramas y simplemente no exista en el archivo.

Velocidad de fotogramas variable (VFR)

Algunas fuentes (grabaciones de pantalla, imágenes telefónicas con poca luz, capturas transmitidas) no utilizan un intervalo constante entre marcos. Emiten fotogramas solo cuando cambia el contenido o varían la velocidad con la luz disponible.

Por qué es importante: "cada décimo fotograma" se convierte en una cantidad de tiempo impredecible en el metraje VFR y la aritmética de la marca de tiempo se desplaza. Si el frame stepping se comporta de manera inconsistente, la VFR es una causa probable. La conversión a una velocidad de fotogramas constante antes de la extracción elimina el problema.

Código de tiempo

Un identificador de posición, normalmente escrito HH:MM:SS:FF donde FF es el número de fotograma dentro del segundo. Distinto del tiempo de reproducción transcurrido.

Por qué es importante: Así es como registras qué fotograma tomaste de manera que alguien más pueda encontrarlo nuevamente. Una marca de tiempo de milisegundos tiene el mismo propósito para la mayoría de los trabajos que no son de transmisión.

Tipos de compresión y fotogramas

I-frame (fotograma clave, fotograma intracodificado)

Un fotograma almacenado como una imagen completa, independiente de todos los demás fotogramas. Aproximadamente equivalente a un JPEG independiente dentro de la transmisión de vídeo.

Por qué es importante: Los marcos I son donde puede comenzar un decodificador. Buscar una posición arbitraria significa saltar al fotograma I anterior y decodificar hacia adelante, razón por la cual la búsqueda en algunos archivos resulta lenta e imprecisa.

P-frame (frame predicho)

Almacena sólo las diferencias de un fotograma anterior. Mucho más pequeño que un fotograma I.

Por qué es importante: No se puede colocar un marco P decodificado solo. Este es el mecanismo detrás de la mayor parte de la eficiencia de la compresión de video, y detrás del hecho de que no se puede simplemente extraer el fotograma 4,732 de un archivo sin decodificar lo que vino antes.

Fotograma B (fotograma bidireccional)

Almacena las diferencias tanto de un fotograma anterior como de un más tarde cuadro. El más pequeño de los tres tipos.

Por qué es importante: Los fotogramas B significan que el orden de almacenamiento en el archivo es diferente del orden de visualización, que es una de las razones por las que la búsqueda precisa de fotogramas es más difícil de lo que parece desde fuera.

GOP (grupo de imágenes)

El patrón repetido de los fotogramas I, P y B; por ejemplo, un fotograma I seguido de otros 29, luego otro fotograma I.

Por qué es importante: un GOP largo significa que los fotogramas I están muy separados, lo que hace que la búsqueda sea más tosca. Los archivos optimizados para streaming suelen tener GOP de varios segundos; las imágenes tomadas directamente desde una cámara generalmente tienen imágenes más cortas.

Velocidad de bits

Datos por segundo de video, en Mbps. Las imágenes del teléfono suelen ser de 10 a 50 Mbps; vídeo transmitido 3–8; los códecs intermedios profesionales pueden superar los 200.

Por qué es importante: es el predictor más sólido de qué tan bien se verá un fotograma extraído. Un fotograma 4K de una transmisión de 5 Mbps mostrará artefactos de compresión que un fotograma de 1080p de un archivo de cámara de 50 Mbps no mostrará; la resolución por sí sola no indica la calidad de la imagen.

Con pérdida y sin pérdida

La compresión con pérdida descarta la información de forma permanente (H.264, JPEG, MP3). Lossless conserva cada valor exactamente (PNG, FFV1, FLAC).

Por qué es importante: extraer a PNG desde una fuente con pérdidas no restaura nada: obtiene una copia sin pérdidas de píxeles ya degradados. Lo que sí evita es añadiendo una segunda generación de pérdida, lo que importa si el fotograma se editará posteriormente.

Color y píxeles

Submuestreo de croma (4:4:4, 4:2:2, 4:2:0)

El vídeo almacena el brillo en resolución completa y el color en resolución reducida, porque la visión humana es mucho más sensible al primero. La notación describe cuánto color se mantiene: 4:4:4 es completo, 4:2:2 es la mitad horizontalmente, 4:2:0 es la mitad en ambas direcciones.

Por qué es importante: casi todos los vídeos de consumo son 4:2:0, por lo que un fotograma extraído tiene detalles de color a la mitad de la resolución en cada dirección. Es invisible en contenido fotográfico, pero muy visible en bordes de colores nítidos: el texto rojo sobre un fondo oscuro es el caso clásico y es una propiedad de la fuente, no un fallo de la extracción.

Espacio de color (Rec. 709, Rec. 2020, sRGB)

La definición de lo que significan los números almacenados como colores. El vídeo HD suele ser Rec. 709, HDR a menudo Rec. 2020, imágenes fijas normalmente sRGB.

Por qué es importante: Rec. 709 y sRGB son similares pero no idénticos. Las fuentes HDR son muy diferentes, y un cuadro HDR extraído sin mapeo de tonos generalmente se ve descolorido y plano.

Rango limitado y rango completo

El video convencionalmente coloca negro en el valor de código 16 y blanco en 235, reservando espacio libre a ambos lados. Las imágenes fijas utilizan el 0–255 completo.

Por qué es importante: esta es la causa más común de que "mi fotograma extraído se vea más aburrido que el vídeo". Si no se aplica la conversión, los negros salen grises y la imagen parece plana; aplicado dos veces, las sombras se aplastan y las luces se recortan. Tampoco es una pérdida de calidad: es un desajuste de suposiciones.

Profundidad de bits

Bits por canal de color. El vídeo de consumo suele ser de 8 bits (256 niveles por canal); El metraje profesional y HDR es de 10 o 12 bits.

Por qué es importante: 8 bits muestra bandas visibles en gradientes suaves, más obviamente cielos. La extracción a PNG conserva la profundidad que tenía la fuente, pero no puede agregar niveles que nunca se grabaron.

Gamma

La relación no lineal entre los valores almacenados y el brillo mostrado. Los canales de vídeo e imágenes fijas no siempre asumen la misma curva.

Por qué es importante: una falta de coincidencia gamma cambia el brillo de los medios tonos: la imagen se ve ligeramente demasiado oscura o demasiado clara en general, sin ningún cambio en los puntos blanco y negro.

Formatos y contenedores

Contenedor versus códec

El contenedor es el contenedor del archivo (MP4, MOV, MKV, WebM). El códec es el método de compresión del contenido interno (H.264, HEVC, VP9, ​​AV1, ProRes).

Por qué es importante: esto explica la falla más confusa en la extracción de fotogramas: dos archivos con nombres .mp4, uno se abre y el otro no. La extensión describe la caja, no lo que contiene. Un MP4 que contenga HEVC puede rechazarse cuando funciona un MP4 que contenga H.264.

H.264 (AVC)

El códec de vídeo más compatible. Se reproduce esencialmente en todas partes.

Por qué es importante: si un archivo no se abre en una herramienta basada en navegador, la transcodificación a H.264 en un contenedor MP4 es la solución que funciona casi siempre.

HEVC (H.265)

El sucesor de H.264: aproximadamente la mitad de la tasa de bits para una calidad similar. Valor predeterminado para grabaciones iPhone desde iOS 11.

Por qué es importante: La compatibilidad del navegador es irregular y depende de la plataforma. Un vídeo iPhone que no se carga en una herramienta de navegador suele ser HEVC.

ProRes y DNxHD

Códecs intermedios utilizados en la edición. Archivos muy grandes, compresión muy ligera, diseñados para recodificación repetida.

Por qué es importante: ningún navegador los decodifica. Estos son los casos más claros para usar FFmpeg o un editor en lugar de una herramienta web.

PNG

Formato de imagen sin pérdidas con un canal alfa. Archivos más grandes.

Por qué es importante: la elección correcta para fotogramas extraídos que se editarán, analizarán, medirán o archivarán.

JPEG

Formato de imagen con pérdida con una configuración de calidad, normalmente de 1 a 100. Aproximadamente una décima parte del tamaño de PNG en alta calidad.

Por qué es importante: la elección correcta cuando necesita muchos fotogramas y el destino es un documento, un ticket o un conjunto de entrenamiento que tolera una compresión suave. Tenga en cuenta que su escala de calidad no está estandarizada entre herramientas: "90" en una aplicación no es exactamente "90" en otra.

WebP

Un formato de imagen más nuevo con modos con y sin pérdida, aproximadamente entre un 25 % y un 30 % más pequeño que JPEG con una calidad comparable.

Por qué es importante: bueno para entrega web, menos aceptado universalmente por el software de escritorio que PNG y JPEG. Elíjalo cuando los marcos vayan a una página web en lugar de a una herramienta.

Términos del flujo de trabajo de extracción

Intervalo de muestreo

La brecha entre fotogramas extraídos, expresada en segundos (uno cada 5 s) o en fotogramas (cada 10).

Por qué es importante: las dos lecturas dan resultados completamente diferentes en el mismo archivo, y confundirlas es la causa más común de terminar con muchas más o muchas menos imágenes de las previstas.

Hoja de contactos

Una cuadrícula de fotogramas extraídos vistos juntos. Tomado prestado de la película, donde una hoja de prueba te permite elegir los negativos de un vistazo.

Por qué es importante: los patrones a lo largo del tiempo (una brecha que se abre, un cambio de estado, la aparición de un defecto) son visibles en una cuadrícula de una manera que no lo son durante la reproducción.

Relleno cero

Escribir números de secuencia con ceros a la izquierda: frame_0001 en lugar de frame_1.

Por qué es importante: los nombres de archivos generalmente se ordenan como texto, lo que coloca frame_10 antes frame_2. Cualquier herramienta que lea sus fotogramas en orden de nombre de archivo los reproducirá codificados sin ella.

Procesamiento del lado del cliente

Trabajo realizado en tu navegador en lugar de en un servidor. El archivo se lee del disco a la memoria de la página y nunca se transmite.

Por qué es importante: elimina el tiempo de carga y los límites de tamaño impuestos por el servidor, y es el único acuerdo en el que el metraje bajo un NDA o una obligación de protección de datos se puede procesar a través de una página web. También se puede comprobar: desconéctese de la red y compruebe si todavía funciona.