LLM Aided OCR
目标受众为需要将扫描文档转换为可编辑和准确文本格式的个人或企业,如文档数字化、历史文档恢复、学术研究等。
总访问量: 474,564,576
占比最多地区: US(19.34%)
1,692
简介
llm_aided_ocr是一个高级系统,旨在显著提高光学字符识别(OCR)输出的质量。通过利用尖端的自然语言处理技术和大型语言模型(LLMs),该项目将原始OCR文本转化为高度准确、格式良好、易读的文档。
截图
产品特色
PDF到图像转换
使用Tesseract进行OCR
使用LLMs进行高级错误校正(本地或基于API)
智能文本分块以高效处理
Markdown格式选项
可选的页眉和页码抑制
最终输出的质量评估
支持本地LLMs和基于云的API提供商(OpenAI, Anthropic)
异步处理以提高性能
详细的日志记录用于过程跟踪和调试
GPU加速本地LLM推理
使用教程
1. 将PDF文件放置在项目目录中。
2. 更新main()函数中的input_pdf_file_path变量为您的PDF文件名。
3. 运行脚本:python llm_aided_ocr.py。
4. 脚本将生成多个输出文件,包括最终处理后的文本。
5. 检查生成的{base_name}__raw_ocr_output.txt文件,这是Tesseract的原始OCR输出。
6. 查看{base_name}_llm_corrected.md文件,这是经过LLM校正和格式化的最终文本。
7. 根据需要,查看日志文件以了解处理过程和质量评估。
流量来源
直接访问51.61%外链引荐33.46%邮件0.04%
自然搜索12.58%社交媒体2.19%展示广告0.11%
最新流量情况
月访问量
4.92m
平均访问时长
393.01
每次访问页数
6.11
跳出率
36.20%
总流量趋势图
地理流量分布情况
美国
19.34%
中国
13.25%
印度
9.32%
俄罗斯
4.28%
德国
3.63%
地理流量分布全球图
同类开源产品
Audeus
Audeus for Chrome是一款文本转语音的Chrome浏览器扩展程序,它通过使用人工智能技术,将网页、文档等文本内容转化为语音,帮助用户在阅读时节省时间、提高效率。
AI文本转语音#Chrome扩展
F5 TTS
优质新品
F5-TTS是由SWivid团队开发的一个文本到语音合成(TTS)模型,它利用深度学习技术将文本转换为自然流畅、忠实于原文的语音输出。
AI文本转语音#深度学习
Praises
Praises是一款文本转语音(TTS)工具,它通过将文本转换为语音输出,帮助用户更轻松地获取信息。
AI文本转语音#多语言支持
Quickpiperaudiobook
QuickPiperAudiobook是一款能够将PDF、epub、txt、mobi、djvu、HTML、docx等多种文本格式转换为有声读物的桌面客户端软件。
AI文本转语音#有声读物
Open NotebookLM
Open NotebookLM是一个利用开源语言模型和文本到语音模型的工具,它可以处理PDF内容,生成适合音频播客的自然对话,并将其输出为MP3文件。
AI文本转语音#播客制作
Pdf2audio
优质新品
PDF2Audio是一个利用OpenAI的GPT模型将PDF文档转换成音频内容的工具。
AI文本转语音#音频生成
Ezaudio
EzAudio是一个先进的文本到音频(T2A)生成模型,它能够从文本提示中创建高质量的音频。
AI文本转语音#声音生成
Reader Lm 1.5b
Jreader-lm-1.5b是由Jina AI开发的一款文本生成模型,专门用于将HTML格式的内容转换为Markdown格式。
AI文本转语音#内容转换
Reader Lm 0.5b
Jina Reader-LM是一系列将HTML内容转换为Markdown内容的模型,适用于内容转换任务。
AI文本转语音#内容转换
替代品
F5 TTS
优质新品
F5-TTS是由SWivid团队开发的一个文本到语音合成(TTS)模型,它利用深度学习技术将文本转换为自然流畅、忠实于原文的语音输出。
AI文本转语音#深度学习
Praises
Praises是一款文本转语音(TTS)工具,它通过将文本转换为语音输出,帮助用户更轻松地获取信息。
AI文本转语音#多语言支持
Quickpiperaudiobook
QuickPiperAudiobook是一款能够将PDF、epub、txt、mobi、djvu、HTML、docx等多种文本格式转换为有声读物的桌面客户端软件。
AI文本转语音#有声读物
Open NotebookLM
Open NotebookLM是一个利用开源语言模型和文本到语音模型的工具,它可以处理PDF内容,生成适合音频播客的自然对话,并将其输出为MP3文件。
AI文本转语音#播客制作
Pdf2audio
优质新品
PDF2Audio是一个利用OpenAI的GPT模型将PDF文档转换成音频内容的工具。
AI文本转语音#音频生成
Ezaudio
EzAudio是一个先进的文本到音频(T2A)生成模型,它能够从文本提示中创建高质量的音频。
AI文本转语音#声音生成
Reader Lm 1.5b
Jreader-lm-1.5b是由Jina AI开发的一款文本生成模型,专门用于将HTML格式的内容转换为Markdown格式。
AI文本转语音#内容转换
Reader Lm 0.5b
Jina Reader-LM是一系列将HTML内容转换为Markdown内容的模型,适用于内容转换任务。
AI文本转语音#内容转换
Fish Speech V1.4
Fish Speech V1.4是一个领先的文本到语音(TTS)模型,它在多种语言的700,000小时音频数据上进行了训练。
AI文本转语音#多语言支持