ProjectsNewsTranslation pending
Context.dev将网页及多类文件抓取统一至单一API
BIBIBI AT A GLANCEContext.dev推出Scrape Anything,统一抓取网页和约40种文件格式。
Article
Context.dev把所有抓取接口合成一个:网页、PDF、Office文件一次搞定
动察 Beating AI 快讯,YC S26 初创公司 Context.dev 推出 Scrape Anything,把原本分散的网页抓取 API 合并成一个接口。开发者只需要提供一个网页或在线文件 URL,再选择想要的格式,就能一次拿到 Markdown、HTML、截图、页面图片、原始文件或结构化字段。
除了处理普通网页,它目前还支持 PDF、DOCX、PPT、XLSX 等约 40 种文件格式。JavaScript 渲染、代理切换、反爬处理和重试都由 Context.dev 负责,开发者不用自己维护浏览器和代理基础设施。此前这些能力已经存在,这次主要是把不同输入和输出统一到同一个 /v1/web/scrape 接口。
一次普通抓取消耗 1 个 credit,请求多个输出格式仍共用这一次基础计费;使用浏览器操作则为 2 个 credits,PDF OCR 另按恢复页数计费。
Source: https://m.theblockbeats.info/flash/368606
AI-assisted interpretation
The following is analysis, separate from reported facts. Verify important claims independently.
它把不同类型的网页和在线文件抓取能力集中到一个接口,开发者只需提交 URL 并选择输出格式。
Why it matters to readers
开发者可以用同一个接口处理网页、PDF 和 Office 文件,并减少自行维护浏览器与代理基础设施的工作。
如果你要把网页或文件内容交给程序处理,可以关注它支持的输入格式、输出格式和 credits 消耗。
Risks and unknowns
- 以上信息来自所提供的文章,产品能力、价格和支持格式未独立核实。