更新日志新功能

Web Scrape 来了

Web Scrape
Playground 中的 Web Scrape:以 Markdown 返回的 querying.ai 快速入门页面

Web Scrape 将 URL 的主要内容提取为 Markdown,每个完成的请求消耗 1 个积分。

获得的结果

  • markdown:页面正文,保留标题、段落、列表、表格、链接和图片,并去掉网站的页眉、页脚和导航。
  • title、description、author、publishedAt、siteName、language、image:页面声明的信息原样返回。
  • finalUrl 和 statusCode:重定向后的最终地址,以及网站返回的状态码。
  • images:markdown 中的图片,按出现顺序排列并附带替代文本。

工作原理

发送公开的 http 或 https URL,最长 2,048 个字符。Web Scrape 会打开页面,对购物网站商品页这类由脚本绘制的页面先完成渲染再读取,留下读者真正要看的正文、表格和图片。结果是干净的 Markdown,可以直接存储、检索和分析。

用 maxChars 设置长度,范围为 1,000 到 200,000 个字符(默认 100,000)。较长的页面会在段落边界截断,并标记 truncated: true。country(默认 US)决定请求页面时使用的语言和地区。PDF、返回 404 或 410 的页面以及拒绝请求的网站会以 PAGE_UNAVAILABLE 结束,消息中附带网站的响应。

应用场景

  • 阅读 AI 回答引用的页面,了解哪些内容能获得引用。
  • 传入 GOOGLE_SERP 结果中的 link,阅读每个搜索词排名靠前的页面。
  • 把竞争对手的商品页和价格页收集为文本,按时间进行比较。
  • 通过 MCP 工具 scrape_page,在 AI 助手中直接读取页面。

发送请求

在 Authorization 请求头中带上 API 密钥发送请求。

curl -X POST https://api.querying.ai/v1/async/task \
  -H "Authorization: Bearer $QUERYING_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "taskType": "WEB_SCRAPE",
    "payload": {
      "url": "https://docs.querying.ai/quickstart",
      "country": "US"
    }
  }'

请求字段

taskTypestring必填
要运行的引擎,例如 CHATGPT 或 GOOGLE。
payload.urlstring必填
要读取的页面:公开的 http 或 https 地址,最多 2,048 个字符。
payload.maxCharsinteger
markdown 的长度上限,1,000 到 200,000,默认 100,000。更长的页面在段落处结束并带上 truncated。
payload.countrystring
请求页面所用的国家,决定页面的语言和地区。默认 US。
webhook.urlstring
你服务器上的 HTTPS 地址。任务完成后立即把结果推送到这里。
idempotencyKeystring
你为请求设定的 ID。每个键在账户内对应一个任务,因此重试发送后仍是同一个任务。

响应

完成的任务如下所示,已截取部分内容。

JSON
{
  "success": true,
  "task": {
    "id": "910017b1-4fd5-4bc7-8895-bbe6b1b0d1df",
    "taskType": "WEB_SCRAPE",
    "status": "COMPLETED",
    "createdAt": "2026-10-02T15:48:34.088Z"
  },
  "credits": { "creditsToCharge": 1, "creditsCharged": 1 },
  "response": {
    "url": "https://docs.querying.ai/quickstart",
    "finalUrl": "https://docs.querying.ai/quickstart",
    "statusCode": 200,
    "title": "AI Search Data API Quickstart",
    "description": "Submit a task, receive a result — with webhooks or by polling.",
    "siteName": "querying.ai",
    "language": "en",
    "markdown": "# AI Search Data API Quickstart\n\n[한국어 시작 가이드](https://querying.ai/ko/guides/quickstart) · [API plans and credits](https://querying.ai/en/pricing)\n\n## 1\\. Set your credentials\n\n```shellscript\nexport BASE=\"https://api.querying.ai\"\nexport API_KEY=\"<your-key>\"\n```\n\n…",
    "images": [],
    "truncated": false
  }
}
task.statusstring
依次为 QUEUED、PROCESSING,最终为附带回答的 COMPLETED 或附带 error 的 FAILED。
credits.creditsChargedinteger
已完成任务扣除的积分。失败的任务为 0。
response.markdownstring
Markdown 格式的页面正文:标题、段落、列表、表格、链接和图片。
response.titlestring
页面标题。页面声明时还会附带 description、author、siteName 和 language。
response.publishedAtstring
页面声明的发布日期,ISO 8601 格式。
response.finalUrlstring
跳转后的最终地址,以及 statusCode。
response.imagesarray
markdown 中的图片,按正文顺序排列,每张含 url 和 alt。
response.truncatedboolean
markdown 达到 maxChars 并在段落处结束时为 true。

获取结果

请求会立即返回 status 为 QUEUED 的任务。用 GET /v1/async/task/{id} 轮询,直到 status 变为 COMPLETED 或 FAILED;或者加上 webhook.url,在服务器上接收同样的 task、credits 和 response。任务结束后,结果保留 24 小时供查询。

curl https://api.querying.ai/v1/async/task/$TASK_ID \
  -H "Authorization: Bearer $QUERYING_API_KEY"

价格

每个完成的页面消耗 1 个积分。

更多更新

接收最新消息

通过邮件接收产品更新。

RSS 订阅