微信扫码
添加专属顾问
我要投稿
LangChain 非常强大的一点就是封装了非常多强大的工具可以直接使用。降低了使用者的学习成本。比如数据网页爬取。
在其官方文档-网页爬取中,也有非常好的示例。
信息爬取。
RAG 信息检索。
从 ceshiren 网站中获取每个帖子的名称以及其对应的url信息。
ceshiren论坛地址:https://ceshiren.com/
# 定义大模型from langchain_openai import ChatOpenAIllm = ChatOpenAI(temperature=0, model="gpt-3.5-turbo-0613")# 定义提取方法def extract(content: str, schema: dict):from langchain.chains import create_extraction_chainreturn create_extraction_chain(schema=schema, llm=llm).invoke(content)import pprintfrom langchain_text_splitters import RecursiveCharacterTextSplitterdef scrape_with_playwright(urls, schema):# 加载数据loader = AsyncChromiumLoader(urls)docs = loader.load()# 数据转换bs_transformer = BeautifulSoupTransformer()# 提取其中的span标签docs_transformed = bs_transformer.transform_documents(docs, tags_to_extract=["span"])# 数据切分splitter = RecursiveCharacterTextSplitter.from_tiktoken_encoder(chunk_size=1000, chunk_overlap=0)splits = splitter.split_documents(docs_transformed)# 因为数据量太大,输入第一片数据使用,传入使用的架构extracted_content = extract(schema=schema, content=splits[0].page_content)pprint.pprint(extracted_content)return extracted_contenturls = ["https://ceshiren.com/"]schema = {"properties": {"title": {"type": "string"},"url": {"type": "string"},},"required": ["title", "url"],}extracted_content = scrape_with_playwright(urls, schema=schema)
了解网页爬取的实现思路以及相关技术。
通过LangChain实现爬取测试人网页的标题和url。
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2026-02-04
Agent生态碎片化终结,.agents/skills统一所有工具
2026-01-29
自建一个 Agent 很难吗?一语道破,万语难明
2026-01-28
全球首个Skills Vibe Agents,AtomStorm技术揭秘:我是怎么用Context Engineering让Agent不"变傻"的
2026-01-22
Deepagents落地场景来了:用openwork实现专属办公小管家
2026-01-05
快速上手:LangChain + AgentRun 浏览器沙箱极简集成指南
2026-01-05
为什么大模型企业都在强调可以连续工作XX小时的Agent和模型?长时运行Agent解析(Long-Running Agents)
2025-12-29
单agent落幕,双agent才能解决复杂问题!附LangGraph+Milvus实操
2025-12-28
为什么说LangGraph是企业级AI智能体的「终极答案」?
2025-12-21
2025-12-21
2025-11-25
2025-12-08
2025-11-08
2025-11-18
2025-11-07
2025-11-25
2025-11-19
2026-01-05
2025-11-03
2025-10-29
2025-07-14
2025-07-13
2025-07-05
2025-06-26
2025-06-13
2025-05-21