微信扫码
添加专属顾问
我要投稿
LangChain 非常强大的一点就是封装了非常多强大的工具可以直接使用。降低了使用者的学习成本。比如数据网页爬取。
在其官方文档-网页爬取中,也有非常好的示例。
信息爬取。
RAG 信息检索。
从 ceshiren 网站中获取每个帖子的名称以及其对应的url信息。
ceshiren论坛地址:https://ceshiren.com/
# 定义大模型
from langchain_openai import ChatOpenAI
llm = ChatOpenAI(temperature=0, model="gpt-3.5-turbo-0613")
# 定义提取方法
def extract(content: str, schema: dict):
from langchain.chains import create_extraction_chain
return create_extraction_chain(schema=schema, llm=llm).invoke(content)
import pprint
from langchain_text_splitters import RecursiveCharacterTextSplitter
def scrape_with_playwright(urls, schema):
# 加载数据
loader = AsyncChromiumLoader(urls)
docs = loader.load()
# 数据转换
bs_transformer = BeautifulSoupTransformer()
# 提取其中的span标签
docs_transformed = bs_transformer.transform_documents(
docs, tags_to_extract=["span"]
)
# 数据切分
splitter = RecursiveCharacterTextSplitter.from_tiktoken_encoder(
chunk_size=1000, chunk_overlap=0)
splits = splitter.split_documents(docs_transformed)
# 因为数据量太大,输入第一片数据使用,传入使用的架构
extracted_content = extract(schema=schema, content=splits[0].page_content)
pprint.pprint(extracted_content)
return extracted_content
urls = ["https://ceshiren.com/"]
schema = {
"properties": {
"title": {"type": "string"},
"url": {"type": "string"},
},
"required": ["title", "url"],
}
extracted_content = scrape_with_playwright(urls, schema=schema)
了解网页爬取的实现思路以及相关技术。
通过LangChain实现爬取测试人网页的标题和url。
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2025-08-30
LangChain如何使用通义千问的向量模型
2025-08-29
Claude code prompt原来这么写的,怪不得这么厉害
2025-08-27
从LangChain到LangGraph:AI智能体提示词工程的系统化学习
2025-08-25
Agent实战教程:LangGraph相关概念介绍以及快速入门
2025-08-23
企业级复杂任务智能体构建:解锁LangChain新品Deep Agents及其UI利器
2025-08-20
使用LLamaIndex Workflow来打造水墨风格图片生成工作流
2025-08-19
让 LangChain 知识图谱抽取更聪明:BAML 模糊解析助力升级
2025-08-17
Manus、LangChain一手经验:先别给Multi Agent判死刑,是你不会管理上下文
2025-07-14
2025-06-26
2025-07-14
2025-07-16
2025-06-16
2025-08-19
2025-06-26
2025-06-13
2025-06-16
2025-06-11
2025-07-14
2025-07-13
2025-07-05
2025-06-26
2025-06-13
2025-05-21
2025-05-19
2025-05-08