什么是卷积-程序员宅基地

技术标签: 计算机视觉  人工智能  神经网络  

卷积是什么鬼

卷积(convolution)
卷积: f ( t ) ∗ g ( t ) = ∫ f ( τ ) g ( τ ) d ( τ ) 卷积运算符号用 ∗ 号来表示 卷积:f(t)*g(t)=\int{f(τ)g(τ)d(τ)}\\ 卷积运算符号用*号来表示 卷积:f(t)g(t)=f(τ)g(τ)d(τ)卷积运算符号用号来表示
 卷积本质上还是运算,不过要比常见的加减乘除要高级的多,如果要用一句人话来讲:它用极简的数学形式,漂亮的描述了一个动态过程。

 这个过程用个一个故事来表达:假设有一列火车g(t)和一个山洞f(t)摆在摆在同一个数轴上,这时火车头和山洞入口都在最左侧,如果现在我们想要描述火车进山的过程,该怎么办。

image-20220918214241904

这是应该把火车旋转一下,让车头冲着山洞口,然后再一点点驶入山洞,这个过程才是卷积要解决的问题。

image-20220918214655133

 用数学语言来描述,把火车旋转就是把g(τ)变成g(-τ),这里我们用临时变量τ代替了原有的变量t,如此车身就被甩到了y轴左侧。
 然后配上全局变量t,得到g(t-τ),火车就可以运动起来了,乘积f(τ)乘以g(t-τ),表示火车进入山洞后每一时刻t两者相对的位置。
 积分也就是累加和,即记录了火车进入山洞后两者不断重叠、互相作用的过程。

image-20220918215515864

 现在把火车和山洞都简化为函数曲线,比如用红色的方波表示几何,黑色的曲线表示山洞\两个函数图像重叠的黄色区域面积,就是传说中的f(t)*g(t),有时也写成(f*g)(t)

image-20220918220154213

 两个函数f和g可以是各种弯弯曲曲的形式,但它们的卷积表示的都是一个函数转进另一个函数肚子里的动态过程

image-20220918220624867

 因为要从头部开始进去,所以要先进行函数旋转,这两个函数的角色其实是可以函数互换的,也就是说可以是火车进山洞,也可以是山洞套火车,这就是所谓的卷积交换性质

 卷积函数不仅可以连续的曲线,也可以是离散的形式如果用连续曲线选取采样点的视角来看两者本质上是一样的
f [ n ] ∗ g [ m ] = ∑ m = − ∞ ∞ f ( m ) g ( n − m ) f[n]*g[m]=\sum^{\infty}_{m=-\infty}f(m)g(n-m) f[n]g[m]=m=f(m)g(nm)
image-20220918223713902

卷积为什么这么牛

微积分: y = ∫ ( x − u ) n P ( x ) d x 微积分:y=\int{(x-u)^nP(x)dx} 微积分:y=(xu)nP(x)dx

 卷积的江湖地位不是一天形成的,数学天才欧拉早在18世纪研究微积分的时候就发现了这样一种能够将多种运算集于一身的有趣形式,但之后相当长的一段时间对它的关注还仅仅局限于数学界。
卷积定理: F [ f 1 ( t ) ∗ f 2 t ] = f 1 ( w ) ⋅ f 2 ( w ) 时域转频域 卷积定理:F[f_1(t)*f_2{t}]=f_1(w)\cdot f_2(w)\\时域转频域 卷积定理:F[f1(t)f2t]=f1(w)f2(w)时域转频域
 1821年,大神傅里叶正式提出卷积概念,并成功应用到物理领域,借助积分变换解决了信号处理中的时域与频域转换的难题,函数卷积的傅里叶变换等于函数傅里叶变换的乘积,这就是著名的卷积定理,在信号领域有着举足轻重的地位,可以说没有卷积就没有现在的5G、互联网。
y ( t ) = f ( t ) ∗ g ( t ) = ∫ f ( τ ) g ( t − τ ) d τ y(t)=f(t)*g(t)=\int{f(τ)g(t-τ)dτ} y(t)=f(t)g(t)=f(τ)g(tτ)dτ
 20世纪开始,卷积运算被越来越多的科学家为之着迷,其最牛掰之处就在于:简介的数学模型却能高度概括生活中的很多现象,因而成为工程科学领域冉冉升起的耀眼明星

通信领域
人们把卷积看成是将一种信号搬移到另外的一种频率当中,实现了调制功能

image-20220918225629333

物理领域
卷积可以代表系统对某个输入物理量进行影响或者是污染

image-20220918225757113

电路学
卷积是某种系统冲击函数对输入的相应,这类系统就是传说中的线行时不变系统

image-20220918230009729

信号处理
从信号的角度来看,卷积实际上就是对信号进行滤波,系统就是滤波器,过滤出我们感兴趣有价值的信息。

image-20220918230208945

图像处理
在图像处理领域卷积就像是一把好用的搓刀,被广泛应用于平滑、锐化、展宽等各种操作。

image-20220918230419420

不仅如此,自动控制、地震学和医学等许多新兴领域都能看到卷积婀娜的身姿。

如果卷积的牛掰之处到此也就罢了,谁知更恐怖的事情发生了。
 1998年,法国学者Yann LeCun将卷积运算与神经网络结合,提出了著名的卷积神经网络(Convolutional Neural Network)——CNN模型。
 伴随着21世纪海量互联网大数据和GPU等硬件设备的快速发展,深度卷积神经网络自2012年一炮而红,引领了十年间人工智能技术的再度崛起,在众多领域显示了超越人类的强大能力。

卷积神经网络是个啥

 卷积神经网络最早应用在计算机视觉里,我们现在耳熟能详的人脸识别、字符识别背后算法的核心都是CNN技术。

 卷积神经网络在把图片交给神经网络之前先要对图像进行一轮卷积的操作。

 我们知道,视频其实是一组图片以极快的速度交替呈现而出的,其中的每张图片叫做一帧,卷积神经网络就是应用在这样的一帧图像上的。

 计算机是如何处理图片的呢,我们看到的图片实际上是由RGB或者其它颜色模型下多种颜色图像叠加而成的,每种颜色由浅到深有分了0-255一共256个等级,如此一来,我们就可以把图片转化为数字矩阵

image-20220918232123206

 接下来为了提取图像的特征,我们会构建一个正方形的点阵,这个点阵就叫做卷积核,具体的操作过程是重合格子里的数字相乘然后再相加输出新的结果,从左上到右下逐个像素地遍历整个图像,就能得到新的矩阵了,这个过程用数学式子表达就是一个二维离散卷积操作。
y [ n 1 , n 2 ] = x [ n 1 , n 2 ] ∗ h [ n 1 , n 2 ] = ∑ m − ∞ ∞ ∑ m − ∞ ∞ x [ m 1 , m 2 ] ⋅ h [ n 1 − m 1 , n 2 − m 2 ] y[n_1,n_2]=x[n_1,n_2]*h[n_1,n_2]=\sum^{\infty}_{m-\infty}\sum^{\infty}_{m-\infty}x[m_1,m_2]\cdot h[n_1-m_1,n_2-m_2] y[n1,n2]=x[n1,n2]h[n1,n2]=mmx[m1,m2]h[n1m1,n2m2]
image-20220918232716725

 你可能会问原始图像遍历下来,原始图像边缘的像素点不就遍历不到了,这样每次生成新的矩阵就会比原始图像小一圈,为了解决这个问题,在卷积操作之前,一般会给原始图像外面补上一圈0,来保证输入输出维度一致,这个操作就是全零填充

image-20220918233040654

 前面讲卷积操作就是用一个输入乘上系统函数然后计算输出在图像处理中,输入就是原始图像的像素,系统函数就是卷积核,将这也是卷积神经网络得名的由来。
∑ ( 输入信号 f × 系统函数 g ) \sum{(输入信号f×系统函数g)} (输入信号f×系统函数g)
image-20220918233358115

 卷积的意义何在呢,直接来看不同类型的卷积核过滤之后的图像就好了。通过卷积操作能够提取出图像的特征,从而为之后的神经网络计算创造更好的条件,这里的卷积核也常常被叫做过滤器

image-20220918233742875

 伴随着人工智能技术的飞速发展,卷积现在已经几乎渗透进我们知道的每一个技术领域,发挥着越来越重要的作用。

版权声明:本文为博主原创文章,遵循 CC 4.0 BY-SA 版权协议,转载请附上原文出处链接和本声明。
本文链接:https://blog.csdn.net/m0_59598325/article/details/126925370

智能推荐

class和struct的区别-程序员宅基地

文章浏览阅读101次。4.class可以有⽆参的构造函数,struct不可以,必须是有参的构造函数,⽽且在有参的构造函数必须初始。2.Struct适⽤于作为经常使⽤的⼀些数据组合成的新类型,表示诸如点、矩形等主要⽤来存储数据的轻量。1.Class⽐较适合⼤的和复杂的数据,表现抽象和多级别的对象层次时。2.class允许继承、被继承,struct不允许,只能继承接⼝。3.Struct有性能优势,Class有⾯向对象的扩展优势。3.class可以初始化变量,struct不可以。1.class是引⽤类型,struct是值类型。

android使用json后闪退,应用闪退问题:从json信息的解析开始就会闪退-程序员宅基地

文章浏览阅读586次。想实现的功能是点击顶部按钮之后按关键字进行搜索,已经可以从服务器收到反馈的json信息,但从json信息的解析开始就会闪退,加载listview也不知道行不行public abstract class loadlistview{public ListView plv;public String js;public int listlength;public int listvisit;public..._rton转json为什么会闪退

如何使用wordnet词典,得到英文句子的同义句_get_synonyms wordnet-程序员宅基地

文章浏览阅读219次。如何使用wordnet词典,得到英文句子的同义句_get_synonyms wordnet

系统项目报表导出功能开发_积木报表 多线程-程序员宅基地

文章浏览阅读521次。系统项目报表导出 导出任务队列表 + 定时扫描 + 多线程_积木报表 多线程

ajax 如何从服务器上获取数据?_ajax 获取http数据-程序员宅基地

文章浏览阅读1.1k次,点赞9次,收藏9次。使用AJAX技术的好处之一是它能够提供更好的用户体验,因为它允许在不重新加载整个页面的情况下更新网页的某一部分。另外,AJAX还使得开发人员能够创建更复杂、更动态的Web应用程序,因为它们可以在后台与服务器进行通信,而不需要打断用户的浏览体验。在Web开发中,AJAX(Asynchronous JavaScript and XML)是一种常用的技术,用于在不重新加载整个页面的情况下,从服务器获取数据并更新网页的某一部分。使用AJAX,你可以创建异步请求,从而提供更快的响应和更好的用户体验。_ajax 获取http数据

Linux图形终端与字符终端-程序员宅基地

文章浏览阅读2.8k次。登录退出、修改密码、关机重启_字符终端

随便推点

Python与Arduino绘制超声波雷达扫描_超声波扫描建模 python库-程序员宅基地

文章浏览阅读3.8k次,点赞3次,收藏51次。前段时间看到一位发烧友制作的超声波雷达扫描神器,用到了Arduino和Processing,可惜啊,我不会Processing更看不懂人家的程序,咋办呢?嘿嘿,所以我就换了个思路解决,因为我会一点Python啊,那就动手吧!在做这个案例之前先要搞明白一个问题:怎么将Arduino通过超声波检测到的距离反馈到Python端?这个嘛,我首先想到了串行通信接口。没错!就是串口。只要Arduino将数据发送给COM口,然后Python能从COM口读取到这个数据就可以啦!我先写了一个测试程序试了一下,OK!搞定_超声波扫描建模 python库

凯撒加密方法介绍及实例说明-程序员宅基地

文章浏览阅读4.2k次。端—端加密指信息由发送端自动加密,并且由TCP/IP进行数据包封装,然后作为不可阅读和不可识别的数据穿过互联网,当这些信息到达目的地,将被自动重组、解密,而成为可读的数据。不可逆加密算法的特征是加密过程中不需要使用密钥,输入明文后由系统直接经过加密算法处理成密文,这种加密后的数据是无法被解密的,只有重新输入明文,并再次经过同样不可逆的加密算法处理,得到相同的加密密文并被系统重新识别后,才能真正解密。2.使用时,加密者查找明文字母表中需要加密的消息中的每一个字母所在位置,并且写下密文字母表中对应的字母。_凯撒加密

工控协议--cip--协议解析基本记录_cip协议embedded_service_error-程序员宅基地

文章浏览阅读5.7k次。CIP报文解析常用到的几个字段:普通类型服务类型:[0x00], CIP对象:[0x02 Message Router], ioi segments:[XX]PCCC(带cmd和func)服务类型:[0x00], CIP对象:[0x02 Message Router], cmd:[0x101], fnc:[0x101]..._cip协议embedded_service_error

如何在vs2019及以后版本(如vs2022)上添加 添加ActiveX控件中的MFC类_vs添加mfc库-程序员宅基地

文章浏览阅读2.4k次,点赞9次,收藏13次。有时候我们在MFC项目开发过程中,需要用到一些微软已经提供的功能,如VC++使用EXCEL功能,这时候我们就能直接通过VS2019到如EXCEL.EXE方式,生成对应的OLE头文件,然后直接使用功能,那么,我们上篇文章中介绍了vs2017及以前的版本如何来添加。但由于微软某些方面考虑,这种方式已被放弃。从上图中可以看出,这一功能,在从vs2017版本15.9开始,后续版本已经删除了此功能。那么我们如果仍需要此功能,我们如何在新版本中添加呢。_vs添加mfc库

frame_size (1536) was not respected for a non-last frame_frame_size (1024) was not respected for a non-last-程序员宅基地

文章浏览阅读785次。用ac3编码,执行编码函数时报错入如下:[ac3 @ 0x7fed7800f200] frame_size (1536) was not respected for anon-last frame (avcodec_encode_audio2)用ac3编码时每次送入编码器的音频采样数应该是1536个采样,不然就会报上述错误。这个数字并非刻意固定,而是跟ac3内部的编码算法原理相关。全网找不到,国内音视频之路还有很长的路,音视频人一起加油吧~......_frame_size (1024) was not respected for a non-last frame

Android移动应用开发入门_在安卓移动应用开发中要在活动类文件中声迷你一个复选框变量-程序员宅基地

文章浏览阅读230次,点赞2次,收藏2次。创建Android应用程序一个项目里面可以有很多模块,而每一个模块就对应了一个应用程序。项目结构介绍_在安卓移动应用开发中要在活动类文件中声迷你一个复选框变量

推荐文章

热门文章

相关标签