
BLIVA (Better handling of text-rich visual questions with LLM) 是由加州大学圣地亚哥分校和Coinbase Global Inc.共同开发的一个简单而强大的多模态大语言模型。它专门用于处理富文本视觉问题,在多个基准测试中都取得了优异的表现。
git clone https://github.com/mlpc-ucsd/BLIVA
cd BLIVA
pip install -e .
下载模型权重并配置路径
运行推理:
python evaluate.py --answer_qs \ --model_name bliva_vicuna \ --img_path images/example.jpg \ --question "what is this image about?"
python demo.py
BLIVA为处理富文本视觉问题提供了一个简单而强大的解决方案。无论是研究人员还是开发者,都可以通过上述资源快速了解和使用BLIVA。希望这个汇总能帮助大家更好地探索BLIVA的潜力!


AI赋能电商视觉革命,一站式智能商拍平台
潮际好麦深耕服装行业,是国内AI试衣效果最好的软件。使用先进AIGC能力为电商卖家批量提供优质的、低成本的商拍图。合作品牌有Shein、Lazada、安踏、百丽等65个国内外头部品牌,以及国内10万+淘宝、天猫、京东等主流平台的品牌商家,为卖家节省将近85%的出图成本,提升约3倍出图效率,让品牌能够快速上架。


企业专属的AI法律顾问
iTerms是法大大集团旗下法律子品牌,基于最先进的大语言模型(LLM)、专业的法律知识库和强大的智能体架构,帮助企业扫清合规障碍,筑牢风控防线,成为您企业专属的AI法律顾问。


稳定高效的流量提升解决方案,助力品牌曝光