经验首页 前端设计 程序设计 Java相关 移动开发 数据库/运维 软件/图像 大数据/云计算 其他经验
当前位置:技术经验 » 程序设计 » Python » 查看文章
万恶之源 - Python基础知识补充
来源:cnblogs  作者:Meets  时间:2018/10/25 9:31:45  对本文有异议

编码转换

编码回顾:

  1. ASCII : 最早的编码. ??有英??写字?, ?写字?, 数字, ?些特殊字符.

   没有中?, 8个01代码, 8个bit, 1个byte

  2. GBK: 中?国标码, ??包含了ASCII编码和中?常?编码. 16个bit, 2个byte

  3. UNICODE: 万国码, ??包含了全世界所有国家?字的编码. 32个bit, 4个byte, 包含了 ASCII

  4. UTF-8: 可变?度的万国码. 是unicode的?种实现. 最?字符占8位

    1.英?: 8bit 1byte

    2.欧洲?字:16bit 2byte

    3.中?:24bit 3byte

  综上, 除了ASCII码以外, 其他信息不能直接转换.

  在python3的内存中. 在程序运?阶段. 使?的是unicode编码.

    因为unicode是万国码. 什么内容都可以进?显?. 那么在数据传输和存储的时候由于unicode比较浪费空间和资源.

  需要把 unicode转存成UTF-8或者GBK进?存储. 怎么转换呢.

  在python中可以把?字信息进?编码. 编码之后的内容就可以进?传输了.

  编码之后的数据是bytes类型的数据.其实啊. 还是原来的 数据只是经过编码之后表现形式发?了改变?已.

bytes的表现形式:

  1. 英? b'alex' 英?的表现形式和字符串没什么两样

  2. 中? b'\xe4\xb8\xad' 这是?个汉字的UTF-8的bytes表现形式

  1. s = "alex"
  2. print(s.encode("utf-8")) # 将字符串编码成UTF-8
  3. print(s.encode("GBK")) # 将字符串编码成GBK
  4. 结果:
  5. b'alex'
  6. b'alex'
  7. s = "中"
  8. print(s.encode("UTF-8")) # 中?编码成UTF-8
  9. print(s.encode("GBK")) # 中?编码成GBK
  10. 结果:
  11. b'\xe4\xb8\xad'
  12. b'\xd6\xd0'

记住: 英?编码之后的结果和源字符串?致. 中?编码之后的结果根据编码的不同. 编码结果也不同.

    我们能看到. ?个中?的UTF-8编码是3个字节. ?个GBK的中?编码是2个字节.

    编码之后的类型就是bytes类型. 在?络传输和存储的时候我们python是保存和存储的bytes 类型.

    那么在对?接收的时候. 也是接收的bytes类型的数据. 我们可以使?decode()来进?解 码操作.

   把bytes类型的数据还原回我们熟悉的字符串:

  1. s = "我叫李嘉诚"
  2. print(s.encode("utf-8")) #
  3. b'\xe6\x88\x91\xe5\x8f\xab\xe6\x9d\x8e\xe5\x98\x89\xe8\xaf\x9a'
  4. print(b'\xe6\x88\x91\xe5\x8f\xab\xe6\x9d\x8e\xe5\x98\x89\xe8\xaf\x9a'.decod
  5. e("utf-8")) # 解码

编码和解码的时候都需要制定编码格式. 

  1. s = "我是?字" bs = s.encode("GBK")
  2. # 我们这样可以获取到GBK的?字
  3. # 把GBK转换成UTF-8
  4. # ?先要把GBK转换成unicode. 也就是需要解码
  5. s = bs.decode("GBK") # 解码
  6. # 然后需要进?重新编码成UTF-8
  7. bss = s.encode("UTF-8") # 重新编码
  8. print(bss)

基础补充

我们补充给?个字符串基本操作

  1. li = ["李嘉诚", "麻花藤", "?海峰", "刘嘉玲"]
  2. s = "_".join(li)
  3. print(s)
  4. li = "?花?闺?"
  5. s = "_".join(li)
  6. print(s)

列表: 循环删除列表中的每?个元素

  1. li = [11, 22, 33, 44]
  2. for e in li:
  3. li.remove(e)
  4. print(li)
  5. 结果:
  6. [22, 44]

分析原因: for的运?过程. 会有?个指针来记录当前循环的元素是哪?个, ?开始这个指针指向第0 个.

然后获取到第0个元素. 紧接着删除第0个. 这个时候. 原来是第?个的元素会?动的变成 第0个.

然后指针向后移动?次, 指向1元素. 这时原来的1已经变成了0, 也就不会被删除了.

?pop删除试试看:

  1. li = [11, 22, 33, 44]
  2. for i in range(0, len(li)):
  3. del li[i]
  4. print(li)
  5. 结果: 报错
  6. # i= 0, 1, 2 删除的时候li[0] 被删除之后. 后??个就变成了第0个.
  7. # 以此类推. 当i = 2的时候. list中只有?个元素. 但是这个时候删除的是第2个 肯定报错啊

经过分析发现. 循环删除都不?. 不论是?del还是?remove. 都不能实现. 那么pop呢?

  1. for el in li:
  2. li.pop() # pop也不?
  3. print(li)
  4. 结果:
  5. [11, 22]

只有这样才是可以的:

  1. for i in range(0, len(li)): # 循环len(li)次, 然后从后往前删除
  2. li.pop()
  3. print(li)

或者. ?另?个列表来记录你要删除的内容. 然后循环删除

  1. li = [11, 22, 33, 44]
  2. del_li = []
  3. for e in li:
  4. del_li.append(e)
  5. for e in del_li:
  6. li.remove(e)
  7.  
  8. print(li)

注意: 由于删除元素会导致元素的索引改变, 所以容易出现问题. 尽量不要再循环中直接去删 除元素. 可以把要删除的元素添加到另?个集合中然后再批量删除.

dict中的fromkey(),可以帮我们通过list来创建?个dict

  1. dic = dict.fromkeys(["jay", "JJ"], ["周杰伦", "麻花藤"])
  2. print(dic)
  3. 结果:
  4. {'jay': ['周杰伦', '麻花藤'], 'JJ': ['周杰伦', '麻花藤']}

代码中只是更改了jay那个列表. 但是由于jay和JJ?的是同?个列表. 所以. 前?那个改了.  后面那个也会跟着改 

dict中的元素在迭代过程中是不允许进?删除的

  1. dic = {'k1': 'alex', 'k2': 'wusir', 's1': '??板'}
  2. # 删除key中带有'k'的元素
  3. for k in dic:
  4. if 'k' in k:
  5. del dic[k] # dictionary changed size during iteration, 在循环迭
  6. 代的时候不允许进?删除操作
  7. print(dic)

那怎么办呢? 把要删除的元素暂时先保存在?个list中, 然后循环list, 再删除

  1. dic = {'k1': 'alex', 'k2': 'wusir', 's1': '??板'}
  2. dic_del_list = []
  3. # 删除key中带有'k'的元素
  4. for k in dic:
  5. if 'k' in k:
  6. dic_del_list.append(k)
  7. for el in dic_del_list:
  8. del dic[el]
  9. print(dic)

类型转换:

  元组 => 列表 list(tuple)

  列表 => 元组 tuple(list)

  list=>str str.join(list)

  str=>list str.split()

  转换成False的数据:

   0,'',None,[],(),{},set() ==> False  

深浅拷贝

  1. lst1 = ["??狮王", "紫衫?王", "?眉鹰王", "?翼蝠王"]
  2. lst2 = lst1
  3. print(lst1)
  4. print(lst2)
  5. lst1.append("杨逍")
  6. print(lst1)
  7. print(lst2)
  8. 结果:
  9. ['??狮王', '紫衫?王', '?眉鹰王', '?翼蝠王', '杨逍']
  10. ['??狮王', '紫衫?王', '?眉鹰王', '?翼蝠王', '杨逍']
  11.  
  12.  
  13. dic1 = {"id": 123, "name": "谢逊"}
  14. dic2 = dic1
  15. print(dic1)
  16. print(dic2)
  17. dic1['name'] = "范瑶"
  18. print(dic1)
  19. print(dic2)
  20. 结果:
  21. {'id': 123, 'name': '谢逊'}
  22. {'id': 123, 'name': '谢逊'}
  23. {'id': 123, 'name': '范瑶'}
  24. {'id': 123, 'name': '范瑶'}

对于list, set, dict来说, 直接赋值. 其实是把内存地址交给变量. 并不是复制?份内容. 所以. lst1的内存指向和lst2是?样的. lst1改变了, lst2也发?了改变  

浅拷?

  1. lst1 = ["何炅", "杜海涛","周渝?"]
  2. lst2 = lst1.copy()
  3. lst1.append("李嘉诚")
  4. print(lst1)
  5. print(lst2)
  6. print(id(lst1), id(lst2))
  7. 结果:
  8. 两个lst完全不?样. 内存地址和内容也不?样. 发现实现了内存的拷?
  9. lst1 = ["何炅", "杜海涛","周渝?", ["麻花藤", "?芸", "周笔畅"]]
  10. lst2 = lst1.copy()
  11. lst1[3].append("?敌是多磨寂寞")
  12. print(lst1)
  13. print(lst2)
  14. print(id(lst1[3]), id(lst2[3]))
  15. 结果:
  16. ['何炅', '杜海涛', '周渝?', ['麻花藤', '?芸', '周笔畅', '?敌是多磨寂寞']]
  17. ['何炅', '杜海涛', '周渝?', ['麻花藤', '?芸', '周笔畅', '?敌是多磨寂寞']]
  18. 4417248328 4417248328

浅拷?. 只会拷?第?层. 第?层的内容不会拷?. 所以被称为浅拷?

深拷?

  1. import copy
  2. lst1 = ["何炅", "杜海涛","周渝?", ["麻花藤", "?芸", "周笔畅"]]
  3. lst2 = copy.deepcopy(lst1)
  4. lst1[3].append("?敌是多磨寂寞")
  5. print(lst1)
  6. print(lst2)
  7. print(id(lst1[3]), id(lst2[3]))
  8. 结果:
  9. ['何炅', '杜海涛', '周渝?', ['麻花藤', '?芸', '周笔畅', '?敌是多磨寂寞']]
  10. ['何炅', '杜海涛', '周渝?', ['麻花藤', '?芸', '周笔畅']]
  11. 4447221448 4447233800

都不?样了.

深度拷?. 把元素内部的元素完全进?拷?复制. 不会产??个改变另?个跟着 改变的问题 补充?个知识点:

最后我们来看?个?试题: 

  1. a = [1, 2]
  2. a[1] = a
  3. print(a[1])  

文件操作

初识?件操作

使?python来读写?件是非常简单的操作. 我们使?open()函数来打开?个?件, 获取到?件句柄. 然后通过?件句柄就可以进?各种各样的操作了.

根据打开?式的不同能够执?的操作也会有相应的差异.

打开?件的?式: r, w, a, r+, w+, a+, rb, wb, ab, r+b, w+b, a+b 默认使?的是r(只读)模式

只读操作(r, rb)  

  1. f = open("护?少妇嫩模萝莉.txt",mode="r", encoding="utf-8")
  2. content = f.read()
  3. print(content)
  4. f.close()

需要注意encoding表?编码集. 根据?件的实际保存编码进?获取数据, 对于我们??. 更 多的是utf-8.

rb. 读取出来的数据是bytes类型, 在rb模式下. 不能选择encoding字符集.  

  1. f = open("护?少妇嫩模萝莉.txt",mode="rb" )
  2. content = f.read()
  3. print(content)
  4. f.close()
  5. 结果:
  6. b'\xe6\xaf\x85\xe5\x93\xa5, \xe5\xa4\xaa\xe7\x99\xbd,
  7. wuse\n\xe5\x91\xb5\xe5\x91\xb5\n\xe6\x97\xa5\xe5\xa4\xa9'

rb的作?: 在读取非?本?件的时候. 比如读取MP3. 图像. 视频等信息的时候就需要?到 rb. 因为这种数据是没办法直接显?出来的.

在后?我们?件上传下载的时候还会?到. 还有我们看的直播. 实际上都是这种数据

 

 友情链接:直通硅谷  点职佳  北美留学生论坛

本站QQ群:前端 618073944 | Java 606181507 | Python 626812652 | C/C++ 612253063 | 微信 634508462 | 苹果 692586424 | C#/.net 182808419 | PHP 305140648 | 运维 608723728

W3xue 的所有内容仅供测试,对任何法律问题及风险不承担任何责任。通过使用本站内容随之而来的风险与本站无关。
关于我们  |  意见建议  |  捐助我们  |  报错有奖  |  广告合作、友情链接(目前9元/月)请联系QQ:27243702 沸活量
皖ICP备17017327号-2 皖公网安备34020702000426号