LaTeX-OCR一张公式截图三步拿到 LaTeX 源码【免费下载链接】LaTeX-OCRpix2tex: Using a ViT to convert images of equations into LaTeX code.项目地址: https://gitcode.com/GitHub_Trending/la/LaTeX-OCRPDF 里那段公式你想原样搬进自己的手稿却不想一个个字符敲出来。LaTeX-OCRpix2tex做的事就一件输入一张公式图片直接吐出对应的 LaTeX 代码。三步就能拿到第一个结果。模型里有什么ViT 编码器 Transformer 解码器 一个分辨率估计器结构是经典视觉-语言搭配带 ResNet 骨干的 ViT 把图像编码成特征Transformer 再逐 token 解码出 LaTeX词表大小 8000。图片进模型前还有一个独立的小网络负责估计它最适合的分辨率并自动缩放——模型是在低分辨率图上训练的原图越糊反而越接近训练分布高清截图未必是优势。官方测试集上的数字BLEU 0.88、归一化编辑距离 0.10、token 准确率 0.60。token 准确率 0.60 的意思是长公式大概率会有一两个 token 出错所以人工核对不是客套话而是流程的一部分。从安装到出结果最短路径两条命令pip install pix2tex[gui] pix2tex path/to/formula.png前提是 Python 3.7 和 PyTorch 就绪[gui]标签顺带装好 GUI 依赖。首次运行会自动下载约 200MB 的模型权重存进系统用户数据目录不用手动放文件。第二条命令直接输出 LaTeX 代码第一个公式到手。想用 Docker 做环境隔离的话两行就够docker pull lukasblecher/pix2tex:api拉镜像跑起容器后 8502 端口就是 API 服务。两条最常用的路命令行和几行 Python 代码命令行最省事。带路径直接出结果不带路径会进交互模式Windows/macOS 上把图片复制进剪贴板按回车就识别。会话里输t0.5可改采样温度默认 0.333输show能把结果渲染成图片直观核对纯 CPU 机器加--no-cuda。完整参数列表在 pix2tex/main.py。Python 集成四行代码适合写进自己的流水线或批处理脚本from PIL import Image from pix2tex.cli import LatexOCR model LatexOCR() print(model(Image.open(formula.png)))模型只在初始化时加载一次之后每次调用都是热身的。剩下两条路latexocr启动 GUI截图后 MathJax 渲染结果并自动复制到剪贴板适合临时用API 是 FastAPI 服务装[api]标签后python -m pix2tex.api.run起服务8502 端口的POST /predict/接收文件上传适合嵌进更大的系统。让识别准一档的三个小动作截图别放太大。分辨率估计网络会自动缩放但原图如果是整块 4K 屏幕它能救回的信息有限。按看得清的尺寸截识别不对再换个大小重截。裁剪框收紧一点。框里多带的正文、边框、阴影都是模型要分心的非公式区域。框比公式大一点就够别多。同一张图多按两次重试。默认温度 0.333同一张图每次跑的结果可能略有差异。第一次差一个符号第二次可能就对了想彻底锁死结果把温度调到 0。卡住了先看这里症状对照处置首次运行长时间没输出→ 在下载约 200MB 权重不是卡死。网络不稳就先手动把权重下载到用户数据目录Linux 下为~/.cache/pix2tex/再重跑。识别错得多或长公式处理不动→ 先怀疑截图重裁剪、换更小尺寸重截再重试把温度调低可以减少随机性。GUI 在 Linux 上截不了图→ 按桌面环境换工具GNOME 默认用 gnome-screenshotwlroots 系合成器把SCREENSHOT_TOOL环境变量设为grimKDE 设为spectacle。安装细节、依赖标签说明以及温度、图像尺寸上限、词表大小这些超参数都能在 docs/installation.md 和 pix2tex/model/settings/config.yaml 里查到。下次截图里再遇到公式别再手打了按回车就好。【免费下载链接】LaTeX-OCRpix2tex: Using a ViT to convert images of equations into LaTeX code.项目地址: https://gitcode.com/GitHub_Trending/la/LaTeX-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考