Frame rate et timing
Frame rate (fps)
Combien d'images par seconde la vidéo contient. Valeurs courantes : 24 (cinéma), 25 (diffusion PAL), 30 (la plupart des téléphones et vidéo Web), 50 et 60 (sport, jeux, mouvements fluides), 120 et 240 (capture au ralenti).
Pourquoi c'est important ici : il décide du nombre d'images à extraire, et il détermine ce que signifie « image de première étape ». Réglez un outil pas à pas sur la mauvaise fréquence d'images et soit vous voyez la même image deux fois, soit vous sautez silencieusement des images.
Durée d'image
L'inverse de la fréquence d'images : la durée pendant laquelle chaque image reste à l'écran. À 30 ips, 33,3 ms ; à 60 ips, 16,7 ms ; à 24 ips, 41,7 ms.
Pourquoi c'est important : c'est la précision plafond. Si le moment souhaité dure 10 ms et que votre séquence est à 30 ips, elle peut se situer entre deux images et tout simplement ne pas exister dans le fichier.
Fréquence d'image variable (VFR)
Certaines sources (enregistrements d'écran, images téléphoniques en basse lumière, captures en streaming) n'utilisent pas de constante. intervalle entre les images. Ils émettent des images uniquement lorsque le contenu change ou font varier le taux en fonction de la lumière disponible.
Pourquoi c'est important : "chaque 10ème image" devient une durée imprévisible sur les images VFR et l'arithmétique de l'horodatage dérive. Si le pas à pas d’image se comporte de manière incohérente, le VFR est une cause probable. La conversion en fréquence d'images constante avant l'extraction supprime le problème.
Timecode
Un identifiant de position, généralement écrit HH:MM:SS:FF où FF est le numéro d'image dans la seconde. Distinct du temps de lecture écoulé.
Pourquoi c'est important : c'est ainsi que vous enregistrez l'image que vous avez prise de manière à ce que quelqu'un d'autre puisse la retrouver. Un horodatage en millisecondes a le même objectif pour la plupart des travaux non diffusés.
Types de compression et d'image
I-frame (image clé, image intra-codée)
Une image stockée sous forme d'image complète, indépendante de toute autre image. À peu près équivalent à un JPEG autonome dans le flux vidéo.
Pourquoi c'est important : Les images I sont l'endroit où un décodeur peut démarrer. Rechercher une position arbitraire signifie passer à l'image I précédente et décoder en avant — c'est pourquoi la recherche dans certains fichiers semble lente et imprécise.
P-frame (image prédite)
Enregistre uniquement les différences par rapport à une image précédente. Beaucoup plus petit qu'une image I.
Pourquoi c'est important : un cadre P ne peut pas être décodé seul. C'est le mécanisme derrière l'essentiel de l'efficacité de la compression vidéo, et derrière le fait que vous ne pouvez pas simplement extraire l'image 4 732 d'un fichier sans décoder ce qui l'a précédée.
Image B (image bidirectionnelle)
Enregistre les différences par rapport à une image précédente et une plus tard frame. Le plus petit des trois types.
Pourquoi c'est important : Les images B signifient que l'ordre de stockage dans le fichier diffère de celui l'ordre d'affichage, ce qui est l'une des raisons pour lesquelles la recherche précise d'une image est plus difficile qu'il n'y paraît de l'extérieur.
GOP (Groupe d'images)
Le motif répétitif des images I, P et B — par exemple une image I suivie de 29 autres, puis une autre image I.
Pourquoi c'est important : un GOP long signifie que les images I sont éloignées les unes des autres, ce qui rend la recherche plus grossière. Les fichiers optimisés pour le streaming ont souvent des GOP de plusieurs secondes ; les images provenant directement d'un appareil photo ont généralement des images plus courtes.
Débit binaire
Données par seconde de vidéo, en Mbps. Les images téléphoniques sont généralement de 10 à 50 Mbps ; vidéo diffusée 3 à 8 ; les codecs intermédiaires professionnels peuvent dépasser 200.
Pourquoi c'est important : c'est le prédicteur le plus puissant de la qualité d'une image extraite. Une image 4K provenant d'un flux de 5 Mbit/s affichera des artefacts de compression qu'une image 1080p provenant d'un fichier de caméra de 50 Mbit/s ne le fera pas : la résolution à elle seule ne vous indique pas la qualité de l'image.
Avec et sans perte
La compression avec perte supprime définitivement les informations (H.264, JPEG, MP3). Le mode sans perte préserve exactement chaque valeur (PNG, FFV1, FLAC).
Pourquoi c'est important : l'extraction vers PNG à partir d'une source avec perte ne restaure rien — vous obtenez une copie sans perte de pixels déjà dégradés. Ce que cela empêche, c'est que les noms de fichiers de l'extracteur l'ajout une deuxième génération de perte, ce qui est important si l'image sera éditée par la suite.
Couleur et pixels
Sous-échantillonnage de chrominance. (4:4:4, 4:2:2, 4:2:0)
La vidéo stocke la luminosité en pleine résolution et les couleurs en résolution réduite, car la vision humaine est beaucoup plus sensible à la première. La notation décrit la quantité de couleur conservée : 4:4:4 est plein, 4:2:2 est à moitié horizontal, 4:2:0 est à moitié dans les deux sens.
Pourquoi c'est important : presque toutes les vidéos grand public sont en 4:2:0, donc une image extraite a des détails de couleur à moitié résolution dans chaque direction. Il est invisible sur le contenu photographique mais très visible sur les bords colorés nets — le texte rouge sur fond sombre est le cas classique, et c'est une propriété de la source, pas un défaut de l'extraction.
Espace colorimétrique (Rec. 709, Rec. 2020, sRGB)
La définition de ce que signifient les nombres stockés en tant que couleurs. La vidéo HD est généralement Rec. 709, HDR souvent Rec. 2020, images fixes normalement sRGB.
Pourquoi c'est important : Rec. 709 et sRGB sont proches mais pas identiques. Les sources HDR sont très différentes, et une image HDR extraite sans mappage de tons semble généralement délavée et plate.
Plage limitée et plage complète
La vidéo place classiquement le noir à la valeur de code 16 et le blanc à 235, réservant une marge de chaque côté. Les images fixes utilisent la plage complète de 0 à 255.
Pourquoi c'est important : c'est la cause la plus courante de « mon image extraite semble plus terne que la vidéo ». Si la conversion n'est pas appliquée, les noirs ressortent gris et l'image paraît plate ; appliqué deux fois, les ombres s'écrasent et les reflets sont coupés. Il ne s'agit pas non plus d'une perte de qualité : il s'agit d'une inadéquation des hypothèses.
Profondeur de bits
Bits par canal de couleur. La vidéo grand public est généralement en 8 bits (256 niveaux par canal) ; Les séquences professionnelles et HDR sont au format 10 bits ou 12 bits.
Pourquoi c'est important : 8 bits affiche des bandes visibles dans des dégradés lisses, le plus évidemment le ciel. L'extraction vers PNG préserve la profondeur de la source, mais ne peut pas ajouter de niveaux qui n'ont jamais été enregistrés.
Gamma
La relation non linéaire entre les valeurs stockées et la luminosité affichée. Les pipelines vidéo et d'images fixes ne suivent pas toujours la même courbe.
Pourquoi c'est important : une inadéquation gamma modifie la luminosité des tons moyens - l'image semble globalement légèrement trop sombre ou trop claire, sans aucun changement dans les points noir et blanc.
Formats et conteneurs
Conteneur contre codec
Le conteneur est le wrapper de fichier (MP4, MOV, MKV, WebM). Le codec est la méthode de compression du contenu qu'il contient (H.264, HEVC, VP9, ​​AV1, ProRes).
Pourquoi c'est important : cela explique l'échec le plus déroutant dans l'extraction d'images - deux fichiers tous deux nommés .mp4, on s'ouvre et on ne s'ouvre pas. L'extension décrit la boîte, pas ce qu'elle contient. Un MP4 contenant HEVC peut être refusé lorsqu'un MP4 contenant H.264 fonctionne.
H.264 (AVC)
Le codec vidéo le plus largement pris en charge. Joue pratiquement partout.
Pourquoi c'est important : si un fichier ne s'ouvre pas dans un outil basé sur un navigateur, le transcodage en H.264 dans un conteneur MP4 est la solution qui fonctionne presque à chaque fois.
HEVC (H.265)
Successeur du H.264 : environ la moitié du débit binaire pour une qualité similaire. Valeur par défaut pour les enregistrements iPhone depuis iOS 11.
Pourquoi c'est important : la prise en charge du navigateur est inégale et dépend de la plate-forme. Une vidéo iPhone qui ne se charge pas dans un outil de navigation est très souvent HEVC.
ProRes et DNxHD
Codecs intermédiaires utilisés dans l'édition. Fichiers très volumineux, compression très légère, conçus pour un réencodage répété.
Pourquoi c'est important : aucun navigateur ne les décode. Il s'agit du cas le plus clair d'utilisation de FFmpeg ou d'un éditeur plutôt que d'un outil Web.
PNG
Format d'image sans perte avec canal alpha. Fichiers plus volumineux.
Pourquoi c'est important : le bon choix pour les images extraites qui seront éditées, analysées, mesurées ou archivées.
JPEG
Format d'image avec perte avec un paramètre de qualité, généralement compris entre 1 et 100. Environ un dixième de la taille de PNG en haute qualité.
Pourquoi c'est important : le bon choix lorsque vous avez besoin de plusieurs images et que la destination est un document, un ticket ou un ensemble d'entraînement qui tolère une légère compression. Notez que son échelle de qualité n'est pas standardisée entre les outils : "90" dans une application n'est pas exactement "90" dans une autre.
WebP
Un format d'image plus récent avec des modes avec et sans perte, environ 25 à 30 % plus petit que le JPEG à qualité comparable.
Pourquoi c'est important : bon pour la diffusion sur le Web, moins universellement accepté par les logiciels de bureau que PNG et JPEG. Choisissez-le lorsque les cadres sont envoyés sur une page Web plutôt que dans un outil.
Termes du flux de travail d'extraction
Intervalle d'échantillonnage
L'écart entre les images extraites, exprimé soit en secondes (une toutes les 5 s) ou en images (tous les 10).
Pourquoi c'est important : les deux lectures donnent des résultats complètement différents sur le même fichier, et les confondre est la cause la plus courante de se retrouver avec beaucoup plus ou beaucoup moins d'images que prévu.
Feuille de contact
Une grille d'images extraites visualisées ensemble. Emprunté au cinéma, où une épreuve permet de choisir les négatifs en un coup d'oeil.
Pourquoi c'est important : des modèles au fil du temps (une ouverture, un changement d'état, un défaut apparaissant) sont visibles dans une grille d'une manière qu'ils ne le sont pas pendant la lecture.
Zéro remplissage
Écrire des numéros de séquence avec des zéros non significatifs : frame_0001 plutôt que frame_1.
Pourquoi c'est important : sont généralement triés sous forme de texte, ce qui place frame_10 avant frame_2. Tout outil qui lit vos images dans l'ordre des noms de fichiers les lira brouillées sans cela.
Traitement côté client
Travail effectué dans votre navigateur plutôt que sur un serveur. Le fichier est lu du disque dans la mémoire de la page et n'est jamais transmis.
Pourquoi c'est important : elle supprime le temps de téléchargement et les limites de taille imposées par le serveur, et c'est le seul arrangement dans lequel les images sous un NDA ou une obligation de protection des données peuvent être traitées via une page Web. Il est également testable — déconnectez-vous du réseau et voyez si cela fonctionne toujours.