码农知识堂 - 1000bd
  •   Python
  •   PHP
  •   JS/TS
  •   JAVA
  •   C/C++
  •   C#
  •   GO
  •   Kotlin
  •   Swift
  • 计算机视觉论文精度大纲


    目录

    一、图像分类

    1. AlexNet

    2. VGGNet

    3. GoogleNet_v1

    4. GoogleNet_v2_B

    二、目标检测

    三、视频目标检测

    四、Transformer(变形金刚)

    1.《Attention Is All You Need》

    2.《Version Transformer》

    五、Transformer专栏


    一、图像分类

    1. AlexNet

    AlexNet 论文精度,以及解析网络模型结构_Flying Bulldog的博客-CSDN博客《ImageNet Classification with Deep Convolutional Neural Networks》网络模型的名称由来:第一作者的名字 Alex Krizhevsky我们训练了一个大型的深度卷积神经网络,将ImageNet LSVRC - 2010竞赛中120万幅高分辨率图像分类到1000个不同的类中。在测试数据上,我们分别取得了37.5 %和17.0 %的前1位和前5位错误率,明显优于以往的先进水平。该神经网络包含6000万个参数和65万个神经元,由5个卷积层组成,其中部分卷https://blog.csdn.net/qq_54185421/article/details/125356469

    2. VGGNet

    VGGNet 论文精度,并解析 VGG-16 网络模型结构_Flying Bulldog的博客-CSDN博客_vgg16论文《VERY DEEP CONVOLUTIONAL NETWORKSFOR LARGE-SCALE IMAGE RECOGNITION》所以我们用3个3×3的卷积叠层代替单个7×7的卷积叠层得到了什么?(1)首先,我们用三个非线性校正层(ReLus)代替一个非线性校正层(ReLU),使得决策函数更具区分度。(2)其次,我们减少了参数个数:假设三层3 × 3卷积堆的输入和输出都有C通道,堆栈参数为个权重(3)最后,多个卷积堆叠在一起可以使得模型的深度增加,证明了本文章的结论:深度在视觉表征中的重要性。.https://blog.csdn.net/qq_54185421/article/details/125372642

    3. GoogleNet_v1

    《Going deeper with convolutions》论文精度,并解析GoogLeNet 网络模型结构_Flying Bulldog的博客-CSDN博客在2014年的ImageNet图像识别挑战赛中,⼀个名叫GoogLeNet 的网络架构⼤放异彩。GoogLeNet吸收了NiN《Network In Network》中串联网络的思想,并在此基础上做了改进。这篇论文的⼀个重点是解决了什么样大小的卷积核最合适的问题。毕竟,以前流⾏的网络使用小到1 × 1,⼤到11 × 11的卷积核。本文的⼀个观点是,有时使用不同大小的卷积核组合是有利的。(全都要!)目录一、引言(1)SOTA(state of the art)(2)Hebbian Principe:neurohttps://blog.csdn.net/qq_54185421/article/details/125386728

    4. GoogleNet_v2_B

    经典BN很NB,精读论文《Batch Normalization》_Flying Bulldog的博客-CSDN博客首先看摘要和结论,然后分析核心思想,最后总结表格内容和实验细节。训练深度神经网络是一个复杂的事实,在训练过程中每一层的输入分布随着前一层的参数变化而变化。这就需要较低的学习速率和仔细的参数初始化来减缓训练速度,并且使得具有饱和非线性的模型的训练变得非常困难。我们将这一现象称为内部协变量偏移(internal covariateshift),并通过归一化层输入来解决这个问题。我们的方法从将规范化作为模型架构的一部分和对每个训练小批量执行规范化来吸取其优点。Batch Normalization允许我们使用更高https://blog.csdn.net/qq_54185421/article/details/125429533

    二、目标检测

    待更新。。。

    三、视频目标检测

    待更新。。。

    四、Transformer(变形金刚)

    1.《Attention Is All You Need》

    《Attention Is All You Need》论文精读,并解析Transformer模型结构_Flying Bulldog的博客-CSDN博客建议:结合《Attention Is All You Need》论文观看此文章。Transformer的模型结构如下图所示,通过把“My money don't jiggle jiggle”翻译成“我的钱不摇晃摇晃”来分析Transformer的工作过程。训练过程中,每一次解码器的输出与数据集中的翻译值通过交叉熵计算错误率(一次送入batch_size大小个token,计算错误率),从而对权重进行更新。预测过程,同训练过程相似,即输入英文句子,一个词一个词的翻译成汉语句子。...https://blog.csdn.net/qq_54185421/article/details/125315630

    2.《Version Transformer》

    《Vision Transformer (ViT)》论文精度,并解析ViT模型结构以及代码实现_Flying Bulldog的博客-CSDN博客论文共有22页,表格和图像很多,网络模型结构解释的很清楚,并且用四个公式展示了模型的计算过程;本文章对其进行精度,并对源码进行剖析,希望读者可以耐心读下去。https://blog.csdn.net/qq_54185421/article/details/125345852

    五、Transformer专栏

    https://blog.csdn.net/qq_54185421/category_11847619.htmlhttps://blog.csdn.net/qq_54185421/category_11847619.html

    >>>未完待续。。。 

  • 相关阅读:
    Android 性能优化之UI优化思路,有80%的开发者不知道~
    看得懂的——数据库中的“除”操作
    ARM按键中断控制事件
    2023ES SHOW深圳电子元器件及物料采购展览会!|深圳比创达电子EMC
    C++程序设计--第三章内容
    ElasticSearch-head前端安装以及连接ES基本步骤(linux)
    Java 中的面向数据编程
    液晶显示计算器(显示程序)
    一次I/O操作的过程
    python开发之远程开发工具对比
  • 原文地址:https://blog.csdn.net/qq_54185421/article/details/125571690
  • 最新文章
  • 沪漂五周年了:我越来越迷茫了
    Agentic Skill Routing 实战:别再把所有 Skill 塞进 AI Agent 上下文
    MySQL-Seconds_behind_master的精度误差
    [MAF预定义ChatClient中间件-03]CachingChatClient——利用缓存省钱省时间
    AI的至暗历史:从万众期待到被政府撤资,AI的两次死亡徘徊
    Agent OS :五种驯服不确定性的范式
    PortSwigger SQL注入LAB11
    数据库即时编译JIT
    [Begin]AI Learn Data Day 0
    深度学习进阶(二十七)现代 LLM 的核心架构设计其二:SwiGLU
  • 热门文章
  • 十款代码表白小特效 一个比一个浪漫 赶紧收藏起来吧!!!
    奉劝各位学弟学妹们,该打造你的技术影响力了!
    五年了,我在 CSDN 的两个一百万。
    Java俄罗斯方块,老程序员花了一个周末,连接中学年代!
    面试官都震惊,你这网络基础可以啊!
    你真的会用百度吗?我不信 — 那些不为人知的搜索引擎语法
    心情不好的时候,用 Python 画棵樱花树送给自己吧
    通宵一晚做出来的一款类似CS的第一人称射击游戏Demo!原来做游戏也不是很难,连憨憨学妹都学会了!
    13 万字 C 语言从入门到精通保姆级教程2021 年版
    10行代码集2000张美女图,Python爬虫120例,再上征途
小工具 小游戏
Copyright © 2022 侵权请联系2656653265@qq.com    京ICP备2022015340号-1

京公网安备 11010502049817号