• 音视频开发—FFmpeg 从MP4文件中抽取视频H264数据


    MP4文件存放H264数据方式

    MP4文件是一个多媒体容器格式,它可以包含多种类型的音视频数据,包括H.264视频。MP4文件使用了一种称为“盒子”(box)或“原子”(atom)的层次结构来组织数据。每个盒子都有特定的功能和用途,用于存储文件元数据、音视频数据以及其他信息。

    MP4 文件结构概述

    MP4文件由多个盒子(box)组成,每个盒子都有一个标头(header)和内容(payload)。盒子的层次结构允许MP4文件灵活地存储和组织数据。常见的盒子包括:

    • ftyp:文件类型盒子,包含文件格式信息。
    • moov:电影盒子,包含文件的全局元数据,包括trak(轨道)盒子。
    • mdat:媒体数据盒子,包含实际的音视频数据。
    • moof:电影片段盒子,包含片段元数据,用于流媒体。

    H.264 数据在 MP4 中的存储

    H.264视频数据通常存储在trak盒子中,具体在mdia(媒体)、minf(媒体信息)、stbl(示例表)子盒子中。以下是详细的存储方式:

    1. ftyp 盒子

    ftyp盒子包含文件类型和兼容性信息,指示文件格式和版本。

    2. moov 盒子

    moov盒子包含全局元数据,包括以下关键子盒子:

    • mvhd:电影头盒子,包含全局时间和其他信息。
    • trak:轨道盒子,每个轨道对应一个媒体流(音频、视频、字幕等)。
      • tkhd:轨道头盒子,包含轨道的时间和其他信息。
      • mdia:媒体盒子,包含特定轨道的媒体信息。
        • mdhd:媒体头盒子,包含媒体的时间和其他信息。
        • hdlr:处理器引用盒子,指定该轨道的数据类型(视频、音频等)。
        • minf:媒体信息盒子,包含媒体特定的信息。
          • vmhd:视频媒体信息头盒子,仅用于视频轨道。
          • dinf:数据引用盒子,包含数据引用表。
            • dref:数据引用表盒子,包含指向媒体数据的引用。
          • stbl:示例表盒子,包含示例描述、时间、位置等信息。
            • stsd:示例描述盒子,包含编码类型和详细信息。
              • avc1:包含H.264视频解码信息。
            • stts:时间抽样表,包含帧时间戳信息。
            • stsc:示例到块映射表,定义示例如何映射到块。
            • stsz:示例大小表,包含每个示例的大小。
            • stco:块偏移表,包含数据块在mdat盒子中的偏移。
    3. mdat 盒子

    mdat盒子包含实际的媒体数据,包括H.264视频数据。这点与 Annex-B 格式不同,视频数据通常不包含NAL单元起始码,而是使用长度字段。

    H.264 数据在 stsd 盒子中的存储(AVC1)

    stsd(示例描述盒子)中存储了有关H.264流的详细信息,包括SPS和PPS数据:

    • avc1:视频编码类型描述,包含H.264视频的详细信息。
      • AVCDecoderConfigurationRecord:包含SPS和PPS数据,以及NAL单元的长度信息。

    AVC1与Annex-B 格式(裸 H.264 流)的区别

    起始码 vs 长度字段

    • AVC1 格式:每个 NAL 单元前有一个长度字段,指示该 NAL 单元的大小。长度字段的大小由 lengthSizeMinusOne 决定,通常为 4 字节。
    • Annex-B 格式:每个 NAL 单元前有一个起始码 0x000000010x000001,用于标识NAL单元的边界。

    SPS 和 PPS 数据存储

    • AVC1 格式:SPS 和 PPS 数据存储在 AVCDecoderConfigurationRecord 中,并且在解码器初始化时解析。
    • Annex-B 格式:SPS 和 PPS 数据直接包含在流中,通常位于关键帧之前,以确保解码器能够正确解析。

    用途

    • AVC1 格式:主要用于 MP4 等封装格式,提供高效的存储和随机访问能力
    • Annex-B 格式:主要用于裸流传输和实时流媒体应用,便于NAL单元的识别和提取。

    从MP4文件中提取H264裸流步骤:

    在这里插入图片描述

    完整代码示例:

    #include 
    #include 
    #include 
    #include 
    
    #ifndef AV_WB32
    #   define AV_WB32(p, val) do {                 \
            uint32_t d = (val);                     \
            ((uint8_t*)(p))[3] = (d);               \
            ((uint8_t*)(p))[2] = (d)>>8;            \
            ((uint8_t*)(p))[1] = (d)>>16;           \
            ((uint8_t*)(p))[0] = (d)>>24;           \
        } while(0)
    #endif
    
    
    //读取内存中以大端字节序(big-endian)存储的16位无符号整数
    #ifndef AV_RB16
    #   define AV_RB16(x)                           \
        ((((const uint8_t*)(x))[0] << 8) |          \
          ((const uint8_t*)(x))[1])
    #endif
    
    static int alloc_and_copy(AVPacket *out,
                              const uint8_t *sps_pps, uint32_t sps_pps_size,
                              const uint8_t *in, uint32_t in_size)
    {
        uint32_t offset         = out->size;
        uint8_t nal_header_size = offset ? 3 : 4;
        int err;
    
        err = av_grow_packet(out, sps_pps_size + in_size + nal_header_size);
        if (err < 0)
            return err;
    
        if (sps_pps)
            memcpy(out->data + offset, sps_pps, sps_pps_size);
        memcpy(out->data + sps_pps_size + nal_header_size + offset, in, in_size);
        if (!offset) {
            AV_WB32(out->data + sps_pps_size, 1);
        } else {
            (out->data + offset + sps_pps_size)[0] =
            (out->data + offset + sps_pps_size)[1] = 0;
            (out->data + offset + sps_pps_size)[2] = 1;
        }
    
        return 0;
    }
    
    //将 H.264 编码器的 extradata (额外数据),从 MP4/AVCC 格式转换为 Annex-B 格式,并将其存储在 AVPacket 结构中。
    int h264_extradata_to_annexb(const uint8_t *codec_extradata, const int codec_extradata_size, AVPacket *out_extradata, int padding)
    {
        uint16_t unit_size;
        uint64_t total_size                 = 0;
        uint8_t *out                        = NULL, unit_nb, sps_done = 0,
                 sps_seen                   = 0, pps_seen = 0, sps_offset = 0, pps_offset = 0;
        const uint8_t *extradata            = codec_extradata + 4;
        // 跳过AVCC 格式中的前四个字节,这些信息在解析NAL单元的时候并不需要
        static const uint8_t nalu_header[4] = { 0, 0, 0, 1 }; //填充起始码
        int length_size = (*extradata++ & 0x3) + 1; // retrieve length coded size, 用于指示表示编码数据长度所需字节数
    
        sps_offset = pps_offset = -1;
    
        /* retrieve sps and pps unit(s) */
        unit_nb = *extradata++ & 0x1f; /* number of sps unit(s) */
        if (!unit_nb) {
            goto pps;
        }else {
            sps_offset = 0;
            sps_seen = 1;
        }
    
        while (unit_nb--) {
            int err;
    
            unit_size   = AV_RB16(extradata);
            total_size += unit_size + 4;
            if (total_size > INT_MAX - padding) {
                av_log(NULL, AV_LOG_ERROR,
                       "Too big extradata size, corrupted stream or invalid MP4/AVCC bitstream\n");
                av_free(out);
                return AVERROR(EINVAL);
            }
            if (extradata + 2 + unit_size > codec_extradata + codec_extradata_size) {
                av_log(NULL, AV_LOG_ERROR, "Packet header is not contained in global extradata, "
                       "corrupted stream or invalid MP4/AVCC bitstream\n");
                av_free(out);
                return AVERROR(EINVAL);
            }
            if ((err = av_reallocp(&out, total_size + padding)) < 0)
                return err;
            memcpy(out + total_size - unit_size - 4, nalu_header, 4);
            memcpy(out + total_size - unit_size, extradata + 2, unit_size);
            extradata += 2 + unit_size;
    pps:
            if (!unit_nb && !sps_done++) {
                unit_nb = *extradata++; /* number of pps unit(s) */
                if (unit_nb) {
                    pps_offset = total_size;
                    pps_seen = 1;
                }
            }
        }
    
        if (out)
            memset(out + total_size, 0, padding);
    
        if (!sps_seen)
            av_log(NULL, AV_LOG_WARNING,
                   "Warning: SPS NALU missing or invalid. "
                   "The resulting stream may not play.\n");
    
        if (!pps_seen)
            av_log(NULL, AV_LOG_WARNING,
                   "Warning: PPS NALU missing or invalid. "
                   "The resulting stream may not play.\n");
    
        out_extradata->data      = out;
        out_extradata->size      = total_size;
    
        return length_size;
    }
    //将MP4中的AVCC格式转为annexb格式
    int h264_mp4toannexb(AVFormatContext *fmt_ctx, AVPacket *in, FILE *dst_fd)
    {
    
        AVPacket *out = NULL;
        AVPacket spspps_pkt;
    
        int len;
        uint8_t unit_type;
        int32_t nal_size;
        uint32_t cumul_size    = 0;
        const uint8_t *buf;
        const uint8_t *buf_end;
        int            buf_size;
        int ret = 0, i;
    
        out = av_packet_alloc();  // 
    
        buf      = in->data;
        buf_size = in->size;
        buf_end  = in->data + in->size;
    
        do {
            ret= AVERROR(EINVAL);
            if (buf + 4 /*s->length_size*/ > buf_end)
                goto fail;
    
            for (nal_size = 0, i = 0; i<4/*s->length_size*/; i++)
                nal_size = (nal_size << 8) | buf[i];
    
            buf += 4; /*s->length_size;*/
            unit_type = *buf & 0x1f;  //确定单元类型
    
            if (nal_size > buf_end - buf || nal_size < 0)
                goto fail;
    
            /*
            if (unit_type == 7)
                s->idr_sps_seen = s->new_idr = 1;
            else if (unit_type == 8) {
                s->idr_pps_seen = s->new_idr = 1;
                */
                /* if SPS has not been seen yet, prepend the AVCC one to PPS */
                /*
                if (!s->idr_sps_seen) {
                    if (s->sps_offset == -1)
                        av_log(ctx, AV_LOG_WARNING, "SPS not present in the stream, nor in AVCC, stream may be unreadable\n");
                    else {
                        if ((ret = alloc_and_copy(out,
                                             ctx->par_out->extradata + s->sps_offset,
                                             s->pps_offset != -1 ? s->pps_offset : ctx->par_out->extradata_size - s->sps_offset,
                                             buf, nal_size)) < 0)
                            goto fail;
                        s->idr_sps_seen = 1;
                        goto next_nal;
                    }
                }
            }
            */
    
            /* if this is a new IDR picture following an IDR picture, reset the idr flag.
             * Just check first_mb_in_slice to be 0 as this is the simplest solution.
             * This could be checking idr_pic_id instead, but would complexify the parsing. */
            /*
            if (!s->new_idr && unit_type == 5 && (buf[1] & 0x80))
                s->new_idr = 1;
    
            */
            /* prepend only to the first type 5 NAL unit of an IDR picture, if no sps/pps are already present */
            if (/*s->new_idr && */unit_type == 5 /*&& !s->idr_sps_seen && !s->idr_pps_seen*/) {
    
                //说明是个关键帧,需要将MP4中的SPS/PPS 填充到NAL单元之前    
    
                h264_extradata_to_annexb( fmt_ctx->streams[in->stream_index]->codec->extradata,
                                          fmt_ctx->streams[in->stream_index]->codec->extradata_size,
                                          &spspps_pkt,
                                          AV_INPUT_BUFFER_PADDING_SIZE);
    
                if ((ret=alloc_and_copy(out,
                                   spspps_pkt.data, spspps_pkt.size,
                                   buf, nal_size)) < 0)
                    goto fail;
                /*s->new_idr = 0;*/
            /* if only SPS has been seen, also insert PPS */
            }
            /*else if (s->new_idr && unit_type == 5 && s->idr_sps_seen && !s->idr_pps_seen) {
                if (s->pps_offset == -1) {
                    av_log(ctx, AV_LOG_WARNING, "PPS not present in the stream, nor in AVCC, stream may be unreadable\n");
                    if ((ret = alloc_and_copy(out, NULL, 0, buf, nal_size)) < 0)
                        goto fail;
                } else if ((ret = alloc_and_copy(out,
                                            ctx->par_out->extradata + s->pps_offset, ctx->par_out->extradata_size - s->pps_offset,
                                            buf, nal_size)) < 0)
                    goto fail;
            }*/ else {
                if ((ret=alloc_and_copy(out, NULL, 0, buf, nal_size)) < 0)
                    goto fail;
                /*
                if (!s->new_idr && unit_type == 1) {
                    s->new_idr = 1;
                    s->idr_sps_seen = 0;
                    s->idr_pps_seen = 0;
                }
                */
            }
    
    
            len = fwrite( out->data, 1, out->size, dst_fd);
            if(len != out->size){
                av_log(NULL, AV_LOG_DEBUG, "warning, length of writed data isn't equal pkt.size(%d, %d)\n",
                        len,
                        out->size);
            }
            fflush(dst_fd);
    
    next_nal:
            buf        += nal_size;
            cumul_size += nal_size + 4;//s->length_size;
        } while (cumul_size < buf_size);
    
        /*
        ret = av_packet_copy_props(out, in);
        if (ret < 0)
            goto fail;
    
        */
    fail:
        av_packet_free(&out);
    
        return ret;
    }
    
    int main(int argc, char *argv[])
    {
        int err_code;
        char errors[1024];
    
        char *src_filename = NULL;
        char *dst_filename = NULL;
    
        FILE *dst_fd = NULL;
    
        int video_stream_index = -1;
    
        //AVFormatContext *ofmt_ctx = NULL;
        //AVOutputFormat *output_fmt = NULL;
        //AVStream *out_stream = NULL;
    
        AVFormatContext *fmt_ctx = NULL;
        AVPacket pkt;
    
        //AVFrame *frame = NULL;
    
        av_log_set_level(AV_LOG_DEBUG);
    
        if(argc < 3){
            av_log(NULL, AV_LOG_DEBUG, "the count of parameters should be more than three!\n");
            return -1;
        }
    
        src_filename = argv[1];
        dst_filename = argv[2];
    
        if(src_filename == NULL || dst_filename == NULL){
            av_log(NULL, AV_LOG_ERROR, "src or dts file is null, plz check them!\n");
            return -1;
        }
    
        /*register all formats and codec*/
        av_register_all();
    
        dst_fd = fopen(dst_filename, "wb");
        if (!dst_fd) {
            av_log(NULL, AV_LOG_DEBUG, "Could not open destination file %s\n", dst_filename);
            return -1;
        }
    
        /*open input media file, and allocate format context*/
        if((err_code = avformat_open_input(&fmt_ctx, src_filename, NULL, NULL)) < 0){
            av_strerror(err_code, errors, 1024);
            av_log(NULL, AV_LOG_DEBUG, "Could not open source file: %s, %d(%s)\n",
                   src_filename,
                   err_code,
                   errors);
            return -1;
        }
    
        /*dump input information*/
        av_dump_format(fmt_ctx, 0, src_filename, 0);
    
        /*initialize packet*/
        av_init_packet(&pkt);
        pkt.data = NULL;
        pkt.size = 0;
    
        /*find best video stream*/
        video_stream_index = av_find_best_stream(fmt_ctx, AVMEDIA_TYPE_VIDEO, -1, -1, NULL, 0);
        if(video_stream_index < 0){
            av_log(NULL, AV_LOG_DEBUG, "Could not find %s stream in input file %s\n",
                   av_get_media_type_string(AVMEDIA_TYPE_VIDEO),
                   src_filename);
            return AVERROR(EINVAL);
        }
    
        /*
        if (avformat_write_header(ofmt_ctx, NULL) < 0) {
            av_log(NULL, AV_LOG_DEBUG, "Error occurred when opening output file");
            exit(1);
        }
        */
    
        /*read frames from media file*/
        while(av_read_frame(fmt_ctx, &pkt) >=0 ){
            if(pkt.stream_index == video_stream_index){
                /*
                pkt.stream_index = 0;
                av_write_frame(ofmt_ctx, &pkt);
                av_free_packet(&pkt);
                */
    
                h264_mp4toannexb(fmt_ctx, &pkt, dst_fd);
    
            }
    
            //release pkt->data
            av_packet_unref(&pkt);
        }
    
        //av_write_trailer(ofmt_ctx);
    
        /*close input media file*/
        avformat_close_input(&fmt_ctx);
        if(dst_fd) {
            fclose(dst_fd);
        }
    
        //avio_close(ofmt_ctx->pb);
    
        return 0;
    }
    
    
  • 相关阅读:
    【计网】一、计算机网络概述
    泛型通配符,上下限 ,生活案例介绍
    Python中将“格式“构造为“函数“实现format格式化输出
    gcc 和 g++的区别
    【java实战】项目经验_04
    Linux脚本练习之script080-nginx日志分析之IP统计
    Zookeeper3.7.1分布式安装部署
    软件测试及工程常用词汇(笔记一)
    Ubuntu 下载安装包到本地
    C++原子变量
  • 原文地址:https://blog.csdn.net/weixin_46999174/article/details/140360353