码农知识堂 - 1000bd
  •   Python
  •   PHP
  •   JS/TS
  •   JAVA
  •   C/C++
  •   C#
  •   GO
  •   Kotlin
  •   Swift
  • 跑通CogView教程


    入门小菜鸟,希望像做笔记记录自己学的东西,也希望能帮助到同样入门的人,更希望大佬们帮忙纠错啦~侵权立删。

    目录

    一、代码下载

    二、环境配置

    1、输入命令

    2、安装apex

    三、下载 image tokenizer——vqvae_hard_biggerset_011.pt

    四、下载模型

    五、准备input的文字

    六、运行

    1、报错:-bash: ./scripts/super_resolution.sh: Permission denied —— 权限不足

    2、报错/bin/bash^M:bad interpreter:No such file or directory

    七、结果


    一、代码下载

    GitHub - THUDM/CogView: Text-to-Image generation. The repo for NeurIPS 2021 paper "CogView: Mastering Text-to-Image Generation via Transformers".


    二、环境配置

    我是在linux下实现的

    1、输入命令

    这里要注意pytorch的安装要和cuda的版本相匹配

    pip install -r requirements.txt

    2、安装apex

    这里要注意不是pip install apex,是NVIDIA的apex

    git clone https://github.com/NVIDIA/apex.git

    然后

    cd apex

    然后

    pip install -v --disable-pip-version-check --no-cache-dir --global-option="--cpp_ext" --global-option="--cuda_ext" ./

    这里如果安装失败的话可以考虑一下是不是因为pytorch与cuda版本不符

    补充:验证pytorch与cuda版本是否相符的方法

    1. import torch
    2. print(torch.cuda.is_available())

    如果输出True则OK啦。


    三、下载 image tokenizer——vqvae_hard_biggerset_011.pt

    输入以下命令

    wget https://cloud.tsinghua.edu.cn/f/71607a5dca69417baa8c/?dl=1 -O pretrained/vqvae/vqvae_hard_biggerset_011.pt

    四、下载模型

    下载地址resource

    模型说明

     把它扔上linux服务器后,输入以下命令解压

    rar x cogview-{base, sr, caption}.tar -C pretrained/cogview/

    五、准备input的文字

    新建input.txt,将文本(每行一个)写入其中


    六、运行

    输入以下命令

    ./scripts/text2image.sh --debug

    这里有几个注意点

    1、报错:-bash: ./scripts/super_resolution.sh: Permission denied —— 权限不足

    解决方法一:

    1. cd ../
    2. sudo chmod 777 CogView

    如果还不行的话——解决方法二:

    chmod u+x ./scripts/text2image.sh

    2、报错/bin/bash^M:bad interpreter:No such file or directory

    这个的原因是代码在window上编辑过,变成了dos格式的文件——换行符与unix格式的文件不同。

    查看是否是这个原因的方法——输入以下命令

    cat -A ./scripts/text2image.sh

    从显示结果可以判断,dos格式的文件行尾为^M$,unix格式的文件行尾为$。

    如果判断确实是这个问题,可以用以下命令使dos格式的文件转换为unix格式的文件。

    dos2unix ./scripts/text2image.sh

    使用这条命令的前提是要装dos2unix——安装命令如下

    sudo apt install dos2unix

    七、结果

    我是用cogview-base模型文字生成图片,生成的图片默认在samples_text2image文件夹中。

    虽然很神奇,但是cogview-base的效果不太好(如果是我哪里步骤不对什么的阿巴阿巴导致的效果不好,麻烦提醒我一下,谢谢),感觉还是需要自己加数据继续训练。

    输入“天鹅在吃面包”

    生成:emmm(第四张emmm脑袋嘞?)


  • 相关阅读:
    Font Awesome 教程
    线上动态解析protobuf文件,实现动态热更新
    Github 2024-04-02开源项目日报Top10
    mybatis关联关系映射
    温故知新《设计模式》创建型模式
    资本+商业模式+中国制造的出海跨境电商,走向世界!(Starday)
    P14 JDBC 快速入门
    mybatis小记
    x86 架构的机载计算机,它来了!
    一篇五分生信临床模型预测文章代码复现——Figure 2. 生存分析,箱线图表达改变分析(三)
  • 原文地址:https://blog.csdn.net/weixin_55073640/article/details/126091247
  • 最新文章
  • 【JVM】编译执行与解释执行的区别是什么?JVM 使用哪种方式?
    用 Hashids 优雅解决 C 端自增 ID 暴露问题
    V8引擎 精品漫游指南--Ignition篇(上) 指令 栈帧 槽位 调用约定 内存布局 基础内容
    LLVM Pass快速入门(四):代码插桩
    milkup:桌面端 markdown AI续写和即时渲染
    基于项目工程构建SBOM(软件物料清单)的研究
    鸿蒙应用开发UI基础第二节:鸿蒙应用程序框架核心解析与实操
    .NET 中如何快速实现 List 集合去重?
    扣子Coze实战:从0到1打造抖音+小红书热点监控智能体
    浅谈数据访问层
  • 热门文章
  • 十款代码表白小特效 一个比一个浪漫 赶紧收藏起来吧!!!
    奉劝各位学弟学妹们,该打造你的技术影响力了!
    五年了,我在 CSDN 的两个一百万。
    Java俄罗斯方块,老程序员花了一个周末,连接中学年代!
    面试官都震惊,你这网络基础可以啊!
    你真的会用百度吗?我不信 — 那些不为人知的搜索引擎语法
    心情不好的时候,用 Python 画棵樱花树送给自己吧
    通宵一晚做出来的一款类似CS的第一人称射击游戏Demo!原来做游戏也不是很难,连憨憨学妹都学会了!
    13 万字 C 语言从入门到精通保姆级教程2021 年版
    10行代码集2000张美女图,Python爬虫120例,再上征途
小工具 小游戏
Copyright © 2022 侵权请联系2656653265@qq.com    京ICP备2022015340号-1

京公网安备 11010502049817号