{"as_of":"2026-08-12T11:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:929e7f39efc165ed988f34fa07d530d9c57605ed1f16cd829b5bf30898170fe9","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:25:43.959038Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T07:07:59.925795Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T10:17:58.075590Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"cited_work":{"arxiv_id":"2505.18986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18986","snapshot_observed_at":"2026-07-03T10:17:58.075590Z","title":"VL-SAM-v2: Open-world object detection with general and specific query fusion","venue":null,"work_id":"b34a0281-8115-4ab2-bfdc-3fb5d86ea1bb","year":2025},"citing_paper":{"arxiv_id":"2604.04564","last_updated":"2026-04-06T09:53:31Z","snapshot_observed_at":"2026-07-06T22:53:29.118925Z","submitted_at":"2026-04-06T09:53:31Z","title":"Visual Prompt Based Reasoning for Offroad Mapping using Multimodal LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T19:51:59.102471Z"},"links":{"cited_paper":"/paper/2505.18986","citing_paper":"/paper/2604.04564"},"observation_digest":"sha256:d4f64f2c1197a380d2c3212d728c9e66701d4351e13bf5493cd72ac134ac161b","observation_id":"f945f4ea-7141-4be0-a3e6-3f2553c5d7f9","resolution":{"observed_at":"2026-05-10T22:25:51.983415Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"cited_work":{"arxiv_id":"2505.18986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18986","snapshot_observed_at":"2026-07-03T10:17:58.075590Z","title":"VL-SAM-v2: Open-world object detection with general and specific query fusion","venue":null,"work_id":"b34a0281-8115-4ab2-bfdc-3fb5d86ea1bb","year":2025},"citing_paper":{"arxiv_id":"2605.03456","last_updated":"2026-05-09T04:48:21Z","snapshot_observed_at":"2026-08-11T15:13:53.368709Z","submitted_at":"2026-05-05T07:44:03Z","title":"VL-SAM-v3: Memory-Guided Visual Priors for Open-World Object Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T01:24:56.236650Z"},"links":{"cited_paper":"/paper/2505.18986","citing_paper":"/paper/2605.03456"},"observation_digest":"sha256:2f31f0340652a5756322af9c7304beaa3ad5147ace0e0eeeaa41d4c89170e81a","observation_id":"fdd5e044-6917-4c84-b422-71aaa53799e8","resolution":{"observed_at":"2026-05-12T11:01:30.268838Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"cited_work":{"arxiv_id":"2505.18986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18986","snapshot_observed_at":"2026-07-03T10:17:58.075590Z","title":"VL-SAM-v2: Open-world object detection with general and specific query fusion","venue":null,"work_id":"b34a0281-8115-4ab2-bfdc-3fb5d86ea1bb","year":2025},"citing_paper":{"arxiv_id":"2605.03456","last_updated":"2026-05-09T04:48:21Z","snapshot_observed_at":"2026-08-11T15:13:53.368709Z","submitted_at":"2026-05-05T07:44:03Z","title":"VL-SAM-v3: Memory-Guided Visual Priors for Open-World Object Detection","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T19:14:12.092478Z"},"links":{"cited_paper":"/paper/2505.18986","citing_paper":"/paper/2605.03456"},"observation_digest":"sha256:525c2823d7cecc3c54fe7584eb0f25416f1b8be3b1a95b854bc2349eaefd4687","observation_id":"d0f78be8-c593-4474-959b-3a09d910a640","resolution":{"observed_at":"2026-05-09T06:00:35.844779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"cited_work":{"arxiv_id":"2505.18986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18986","snapshot_observed_at":"2026-07-03T10:17:58.075590Z","title":"VL-SAM-v2: Open-world object detection with general and specific query fusion","venue":null,"work_id":"b34a0281-8115-4ab2-bfdc-3fb5d86ea1bb","year":2025},"citing_paper":{"arxiv_id":"2605.03456","last_updated":"2026-05-09T04:48:21Z","snapshot_observed_at":"2026-08-11T15:13:53.368709Z","submitted_at":"2026-05-05T07:44:03Z","title":"VL-SAM-v3: Memory-Guided Visual Priors for Open-World Object Detection","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T01:33:55.317107Z"},"links":{"cited_paper":"/paper/2505.18986","citing_paper":"/paper/2605.03456"},"observation_digest":"sha256:b48440fde1c2d99c45f1019f4f7ed149236600e1c1603ec414425b168a1c4b61","observation_id":"36545036-448a-4b16-a2fa-2703d6456869","resolution":{"observed_at":"2026-05-12T07:51:48.393215Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"cited_work":{"arxiv_id":"2505.18986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18986","snapshot_observed_at":"2026-07-03T10:17:58.075590Z","title":"VL-SAM-v2: Open-world object detection with general and specific query fusion","venue":null,"work_id":"b34a0281-8115-4ab2-bfdc-3fb5d86ea1bb","year":2025},"citing_paper":{"arxiv_id":"2605.05499","last_updated":"2026-05-06T22:46:59Z","snapshot_observed_at":"2026-08-05T14:02:24.726190Z","submitted_at":"2026-05-06T22:46:59Z","title":"FoodCHA: Multi-Modal LLM Agent for Fine-Grained Food Analysis","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T16:11:26.104498Z"},"links":{"cited_paper":"/paper/2505.18986","citing_paper":"/paper/2605.05499"},"observation_digest":"sha256:5672cb27f08df12730eef61560ccc6a6a13fd912ed0bb82a9e556a8d24cf361b","observation_id":"0e043359-7b35-4c85-b811-1538a58c95d3","resolution":{"observed_at":"2026-05-11T18:21:09.469192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"cited_work":{"arxiv_id":"2505.18986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18986","snapshot_observed_at":"2026-07-03T10:17:58.075590Z","title":"VL-SAM-v2: Open-world object detection with general and specific query fusion","venue":null,"work_id":"b34a0281-8115-4ab2-bfdc-3fb5d86ea1bb","year":2025},"citing_paper":{"arxiv_id":"2605.29416","last_updated":"2026-05-28T06:07:57Z","snapshot_observed_at":"2026-08-05T02:47:57.177913Z","submitted_at":"2026-05-28T06:07:57Z","title":"3DVLA: Enhancing Vision-Language-Action Models via 3D Spatial and Instance Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T07:07:59.925795Z"},"links":{"cited_paper":"/paper/2505.18986","citing_paper":"/paper/2605.29416"},"observation_digest":"sha256:44e8f314d5352276f389f6dfdb0e27f9b773079633e44d40332d6f13d08afcaf","observation_id":"3bae7f73-e0ef-4b89-8e37-602e64d41309","resolution":{"observed_at":"2026-06-29T07:13:16.671658Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"cited_work":{"arxiv_id":"2505.18986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18986","snapshot_observed_at":"2026-07-03T10:17:58.075590Z","title":"VL-SAM-v2: Open-world object detection with general and specific query fusion","venue":null,"work_id":"b34a0281-8115-4ab2-bfdc-3fb5d86ea1bb","year":2025},"citing_paper":{"arxiv_id":"2606.12236","last_updated":"2026-06-11T01:12:41Z","snapshot_observed_at":"2026-08-07T09:18:29.279286Z","submitted_at":"2026-06-10T15:42:25Z","title":"DrivingAgent: Design and Scheduling Agents for Autonomous Driving Systems","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T10:05:38.910257Z"},"links":{"cited_paper":"/paper/2505.18986","citing_paper":"/paper/2606.12236"},"observation_digest":"sha256:d041e8f23a93ccb3c3ac8ed858c4aab318a3de599e0a6202bd73fdb9d59cea19","observation_id":"0aeb88e6-1235-4112-9af7-b80b89eb9aba","resolution":{"observed_at":"2026-07-03T10:17:58.077080Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18986/citation-record","integrity":"/paper/2505.18986/integrity","json":"/paper/2505.18986/citation-record.json","paper":"/paper/2505.18986"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.642390Z","title":"Lang, Sourabh V ora, Venice Erin Liong, Qiang Xu, Anush Krishnan, Yu Pan, Giancarlo Baldan, and Oscar Beijbom","venue":null,"work_id":"82d796b5-13cb-46cc-ad42-f032207a92c9","year":2020},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:41.306134Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:238f82ae23c758d516e222d8fb994816216a228739e0a5f588e8cce9af4adff9","observation_id":"8031d5a1-ae22-493d-b571-74ad3918e70f","resolution":{"observed_at":"2026-08-07T14:25:44.647029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.07155","last_updated":"2019-06-17T17:58:12Z","snapshot_observed_at":"2026-08-03T13:01:27.142233Z","submitted_at":"2019-06-17T17:58:12Z","title":"MMDetection: Open MMLab Detection Toolbox and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.07155","snapshot_observed_at":"2026-08-07T14:25:41.407593Z","title":"Mmdetection: Open mmlab detection toolbox and benchmark","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:41.407593Z"},"links":{"cited_paper":"/paper/1906.07155","citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:a27a4e45d2692332d5264f057ffed6313204e73e7b9935855753083956455ba7","observation_id":"80bd6b94-22d0-4e78-98cc-3191d61c86c3","resolution":{"observed_at":"2026-08-07T14:25:41.407593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:41.524550Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:41.524550Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:e8f4b1c97050b512b8bf2d5cf1ecb7ef9ce1f7c6dea340aeb86cc50b1fce50e5","observation_id":"6815a255-5f92-403c-a406-0daa57900b10","resolution":{"observed_at":"2026-08-07T14:25:41.524550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-08-10T12:15:26.330880Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-08-07T14:25:41.630304Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:41.630304Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:e8921458cc7985c72eeb232f0ca31f354b1b2e95d9f987eb9bc101c148b118f2","observation_id":"7695381b-dbd6-445b-acb7-586bd352201e","resolution":{"observed_at":"2026-08-07T14:25:41.630304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T14:25:41.747798Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:41.747798Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:b72a6db9db83cabcbb6cd480b1a0f1e5c9ff675f610401f227a8a9970934af5a","observation_id":"33c63cf9-3e2e-4215-ada8-85d55d388162","resolution":{"observed_at":"2026-08-07T14:25:41.747798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:41.836297Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:41.836297Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:58d5f05a7bcee3f40184bc06c9791e16225886d96ac7d41df8167d9134f07b36","observation_id":"48a071c6-3d4b-4e2f-bffb-25d64aea5eb1","resolution":{"observed_at":"2026-08-07T14:25:41.836297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.607444Z","title":"Yolo-world: Real- time open-vocabulary object detection","venue":null,"work_id":"2fddbda9-498b-487a-9f87-28c45d5ba00e","year":2024},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:41.984356Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:df29cebb9df633b996189f4d6bca0dd861fa50c64163bbb4c2431930cd8cf050","observation_id":"288d0ccd-d231-4159-be59-242400cd12f7","resolution":{"observed_at":"2026-08-07T14:25:44.612379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.01066","last_updated":"2022-03-15T06:04:05Z","snapshot_observed_at":"2026-08-10T23:04:40.688955Z","submitted_at":"2021-02-01T18:56:02Z","title":"Evaluating Large-Vocabulary Object Detectors: The Devil is in the Details","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.01066","snapshot_observed_at":"2026-08-07T14:25:42.104267Z","title":"Evaluating large- vocabulary object detectors: The devil is in the details","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:42.104267Z"},"links":{"cited_paper":"/paper/2102.01066","citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:0d677187db488a6c9bd1e709a841e110c03a263125f3373557ca6e7eef22bb7a","observation_id":"83de4954-8d7b-44f0-9aa2-636c8924faf8","resolution":{"observed_at":"2026-08-07T14:25:42.104267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.592317Z","title":"Reducing network agnostophobia","venue":null,"work_id":"e4933a97-3b09-4c90-a8b1-c37c6bbbd349","year":2018},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:42.210795Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:27a912ca07dc40b372b0ec478ea14fc4b0c4c734d9ff2ab000bf4867064ba969","observation_id":"b01f4f06-47e3-4fb3-ae57-d385e3b4b817","resolution":{"observed_at":"2026-08-07T14:25:44.596905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.576866Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"a8417af3-fdde-4d9a-a298-d98202b7822e","year":2020},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:42.302873Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:cdae0397946a058c5ef7552a97abddf07ff57bf7691fd1c5341abea39d396850","observation_id":"9db2f7de-1b34-4bd2-9a0c-f139f406c28a","resolution":{"observed_at":"2026-08-07T14:25:44.582137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18954","last_updated":"2025-01-31T08:27:31Z","snapshot_observed_at":"2026-08-10T23:07:52.284721Z","submitted_at":"2025-01-31T08:27:31Z","title":"LLMDet: Learning Strong Open-Vocabulary Object Detectors under the Supervision of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18954","snapshot_observed_at":"2026-08-07T14:25:42.436018Z","title":"Llmdet: Learning strong open-vocabulary object detectors under the supervision of large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:42.436018Z"},"links":{"cited_paper":"/paper/2501.18954","citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:fab528f98a7b1242a2bbda78889301c5613675b4f64fce8d0ac30c8d59c8894b","observation_id":"f63d6b4c-fd85-4bc0-ad99-27228d92063a","resolution":{"observed_at":"2026-08-07T14:25:42.436018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.560636Z","title":"Recent advances in open set recognition: A survey","venue":null,"work_id":"85548c2a-da11-40d8-ac79-2fc5bf3ecb88","year":2020},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:42.562637Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:d6a605e14a69d77a98962cb3a73326e1bebbde56ef02a376bd3f46a1ee723423","observation_id":"19dd24c6-c3e8-4896-9945-e7cf4b572175","resolution":{"observed_at":"2026-08-07T14:25:44.566449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.545265Z","title":"Lvis: A dataset for large vocabulary instance segmentation","venue":null,"work_id":"9f3cbe30-9d6d-4365-ad5d-a8911ec010af","year":2019},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:42.643665Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:e43c0d74a8df7cc3a1ff4c09ea7a14dd4ca6e612737b7e649ed5b1931a5e127a","observation_id":"d1c5f081-6694-4ff2-8139-7c0bcc87d935","resolution":{"observed_at":"2026-08-07T14:25:44.550654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.529846Z","title":"Ow- detr: Open-world detection transformer","venue":null,"work_id":"4cfd7fbd-10dc-46c6-bc3f-5bfc530f7745","year":2022},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:42.746308Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:080bc29219be33c28b63b87767c5dec204068b4288affb8431ec836a21cde8d3","observation_id":"129904e7-f0fc-417d-a952-164a0f83f016","resolution":{"observed_at":"2026-08-07T14:25:44.535337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.515361Z","title":"Momentum contrast for unsupervised visual representation learning","venue":null,"work_id":"a539dde2-09e7-48ac-974b-9304811d18d8","year":2020},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:42.853037Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:a7a9c30e0cab48d4dca11d8a48aceaf1afbcc180744ef88ba87ae4ce5a1761d2","observation_id":"b5ca2b6e-0f50-4553-a3d8-05fb99cb394f","resolution":{"observed_at":"2026-08-07T14:25:44.520086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.500675Z","title":"Mask r-cnn","venue":null,"work_id":"bb2e0604-37ca-448c-bb20-6c1fd015e440","year":2017},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:42.964370Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:d8ec44899c9ccaff346497cb7c97f2aa9d9f93d3695380c1cb11c5df91c302a2","observation_id":"1c8338aa-67bb-4a63-9bc2-2445730ab42b","resolution":{"observed_at":"2026-08-07T14:25:44.505146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.485120Z","title":"T-rex2: Towards generic object detection via text-visual prompt synergy","venue":null,"work_id":"122df147-172f-465e-9dde-c861c7a68c11","year":2024},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.103990Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:bdfdcacc0c8f38b2325f1f87ab77dada3f0b31bc5afdf08693651876ea2f1b7e","observation_id":"e2ea59b2-12b6-42dc-9e04-128fea24ba2f","resolution":{"observed_at":"2026-08-07T14:25:44.490204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.469898Z","title":"Segment anything","venue":null,"work_id":"a483e409-7931-4735-a520-a59461e9f36c","year":2023},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.228584Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:820cf1ac866f17ef44f2713474ba231f3a0baae10574a9f2fab51fa043968034","observation_id":"d3a8e7ce-0b56-4ead-b1f4-6a1d7596a753","resolution":{"observed_at":"2026-08-07T14:25:44.474379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.453785Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":"9aed432d-2251-4a65-a9e0-93aa5a4f743f","year":2024},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.350210Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:4dea60b8fb6bba3b9e2213b8f16d363118981f014b5aba546f98dbfdad601d4a","observation_id":"c0219f15-f889-4c94-a70b-64a2b3560a8c","resolution":{"observed_at":"2026-08-07T14:25:44.458987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T14:25:43.465321Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.465321Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:fd9a7853f20f601b3bb009fa34092efe6159608178ecaefd3f620f52a0d64f1f","observation_id":"95ca5c2d-c1c2-4d79-807c-bc76acb402a1","resolution":{"observed_at":"2026-08-07T14:25:43.465321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.437616Z","title":"Dn-detr: Accelerate detr training by introducing query denoising","venue":null,"work_id":"c5046e43-297b-4003-abf4-a8c9b0e7466c","year":2022},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.514620Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:b93b93f81985b42f7e4ca3374a3fa41fa711805bb28aee13a9937f653230044e","observation_id":"0a9ca5e0-6b27-41a1-bd80-8c35644b54c7","resolution":{"observed_at":"2026-08-07T14:25:44.443299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.420102Z","title":"Coda: A real-world road corner case dataset for object detection in autonomous driving","venue":null,"work_id":"56df99c5-7878-462a-b524-d0433a936e8c","year":2022},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.613826Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:2cde3ffe4c2694ccc5d941e142190c61f00a2224d47bc61bb2f26c71555e7b8d","observation_id":"a9ccb8e4-1767-4134-806f-97bc6c3f423b","resolution":{"observed_at":"2026-08-07T14:25:44.426559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.403574Z","title":"Desco: Learning object recognition with rich language descriptions","venue":null,"work_id":"53e83f68-5a54-45cd-9158-c005bea7a6b9","year":2023},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.758188Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:b98c99150bcd7fe72b6b7833d37557dc5d3d32ddd6aceb58fb722a4c4d4201e7","observation_id":"1767c512-b56c-4a29-8389-15275d85d357","resolution":{"observed_at":"2026-08-07T14:25:44.409036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.388074Z","title":"Grounded language-image pre-training","venue":null,"work_id":"b2165477-234b-49b5-8148-988cd3f57034","year":2022},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.847663Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:6f286baec43ecf5278db6aeadc1ab74cf72aa8f3942c7d4c1d6d60d4caec488b","observation_id":"6188faa5-3e31-4a7e-a0f4-045ff99fa574","resolution":{"observed_at":"2026-08-07T14:25:44.393433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.373208Z","title":"Generative region-language pretraining for open-ended object detection","venue":null,"work_id":"5e0aefa8-ce7b-4db2-8145-2e9255c1fb02","year":2024},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.855977Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:70dfe01d51223f6cd5b565650dc75c27ae8a60190d1827da81c97c2a5dbdddce","observation_id":"1ea8ff82-22a0-4319-a530-fb6425cc897f","resolution":{"observed_at":"2026-08-07T14:25:44.377953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.355645Z","title":"Training-free open-ended object detection and segmentation via attention as prompts","venue":null,"work_id":"c8313c2a-56b1-4255-9755-c5370ce60a24","year":2024},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.862354Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:197d187e7cd5d478d882e66cf5cce7111afda607d0982fd790b58402b5ad7765","observation_id":"b1cd2f1d-0e0a-4292-b2cf-c793afca37fb","resolution":{"observed_at":"2026-08-07T14:25:44.361788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.339660Z","title":"Visual instruction tuning.Neural Information Processing Systems (NeurIPS), 2023","venue":null,"work_id":"dbf0e01e-4673-416f-9596-46ce6be5767c","year":2023},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.867202Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:ea744815a15b1bbc770bc3172bfc689aa24a7e6d4a23560584d6d18eed278f7d","observation_id":"e459fbe4-2f7e-433e-943f-ce29b7572115","resolution":{"observed_at":"2026-08-07T14:25:44.344472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.323040Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":"2c714bc8-0c12-4815-ba7f-02dfac4b0145","year":2024},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.873335Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:4d2829b569a4cb166bc4f61b3305a1039b6cbdd5cd379d7a28f1135d6ee5e15f","observation_id":"65e03801-1900-45f7-a0fb-91aff4a1bc80","resolution":{"observed_at":"2026-08-07T14:25:44.328450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.307033Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"57807ae0-e216-4e8e-b0ea-a5c6a0cf500f","year":2021},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.879076Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:88efebd5fbf99c6d96337b0742e80710ec81f7c398a23d6cbffc9192b0be04da","observation_id":"66878a2e-4dc8-44c5-a84a-3a94ab7d4a43","resolution":{"observed_at":"2026-08-07T14:25:44.312770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.291651Z","title":"Capdet: Unifying dense captioning and open-world detection pretraining","venue":null,"work_id":"f941900d-87ac-48ac-9d22-5bd5b90e1f76","year":2023},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.884458Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:d820ee0a6ccc7b41208ba77b7c00467293cc506d32e9a0e216ce5f491bb7755d","observation_id":"53e798e5-d546-4307-b90d-0fb5d8dc97ad","resolution":{"observed_at":"2026-08-07T14:25:44.296731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.276724Z","title":"Scaling open-vocabulary object detection.Neural Information Processing Systems (NeurIPS), 2023","venue":null,"work_id":"eb8085e9-06df-438f-8132-e93c7df2a873","year":2023},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.889852Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:35660841b3c71bb611dcf341f357a47f30838b2d1c8e3bad6fe81d651ad74fa3","observation_id":"86bf87f0-ecd7-4e52-9836-8ac65fd7ce75","resolution":{"observed_at":"2026-08-07T14:25:44.281439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:43.895759Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.895759Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:15f1c0d3b2e6bf696f601962ecba6c7694ad9df9340b6f1ced38d002cc1dbc82","observation_id":"d0e3482c-010f-4af8-8e77-014c190f77be","resolution":{"observed_at":"2026-08-07T14:25:43.895759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.250040Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks","venue":null,"work_id":"ed90a1ff-4103-4f27-9692-b8412c3f1775","year":2015},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.901395Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:db8e7d394b5889cbf20525dcf2b65f61a64d7aefed44b1099185ac152454d359","observation_id":"1cf861bd-aa92-4732-b410-788eb9ba0f3d","resolution":{"observed_at":"2026-08-07T14:25:44.256381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-07T14:25:43.907816Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.907816Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:dfb6e9f01f6358e25b15bdbd05713988db77b0fc6deefea8bcb668071d70b67f","observation_id":"952f7a13-222b-4092-b791-fa62baf447d8","resolution":{"observed_at":"2026-08-07T14:25:43.907816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.234402Z","title":"Scalability in perception for autonomous driving: Waymo open dataset","venue":null,"work_id":"9a7d1d7a-8367-4d28-b54a-546f8bfe8f0d","year":2020},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.914161Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:a0a73fcd38f7db9930a17154c37384f881812dcfae8b1d53f7dc64e518e33a9b","observation_id":"bc5ded50-7edf-402d-a22f-6193f73cc3b1","resolution":{"observed_at":"2026-08-07T14:25:44.239758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07844","last_updated":"2024-07-22T03:26:21Z","snapshot_observed_at":"2026-08-05T18:50:42.664160Z","submitted_at":"2024-07-10T17:05:49Z","title":"OV-DINO: Unified Open-Vocabulary Detection with Language-Aware Selective Fusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07844","snapshot_observed_at":"2026-08-07T14:25:43.919389Z","title":"Ov-dino: Unified open-vocabulary detection with language-aware selective fusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.919389Z"},"links":{"cited_paper":"/paper/2407.07844","citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:cd31e20c7de5f4cae5caff7c1b7d6bf14549774e525e8b9d4add840cb0b1b49d","observation_id":"46e99aa6-694f-4db8-ab1f-aac1b4d565c3","resolution":{"observed_at":"2026-08-07T14:25:43.919389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.218033Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":"eec4ec91-dca6-4f00-94a1-fa0299733af4","year":2024},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.926211Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:4cc85bf88574c4a7851a30bfe999f176c634a2206102a554493dc5e9317d170c","observation_id":"c90909b2-a67e-4f66-8a7d-cde1ca2d1edb","resolution":{"observed_at":"2026-08-07T14:25:44.223244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.200710Z","title":"Detclipv2: Scalable open-vocabulary object detection pre-training via word-region alignment","venue":null,"work_id":"90c145ab-a883-4c41-8766-4182386f84bd","year":2023},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.931973Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:7cd81922a6703c1b76d99e6d4dff833685dd39530d576507ee8f54550d2c7c17","observation_id":"f802fc6a-8f2c-467f-998a-c86d33c79d40","resolution":{"observed_at":"2026-08-07T14:25:44.207117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.182545Z","title":"Detclip: Dictionary-enriched visual-concept paralleled pre-training for open-world detection","venue":null,"work_id":"26eea1a8-a63f-4b5e-b608-d1e1e2641a8c","year":2022},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.937160Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:2c84c0609f286a3a5b1a5e95857cbfd177d7a45ea482a90802ff75987158ed68","observation_id":"a048e2b5-a136-4b19-ae26-7e841210f4b8","resolution":{"observed_at":"2026-08-07T14:25:44.188398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.166984Z","title":"Detclipv3: Towards versatile generative open-vocabulary object detection","venue":null,"work_id":"221f5ded-922e-45f8-ae9c-a195dfb2e02b","year":2024},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.942085Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:f15e6739554aac36d8eeb81f98363a8a5bea43932056c17cbe90086ad3e6f1d6","observation_id":"0cfd0a67-5e40-40cb-ad5a-0454b65051c3","resolution":{"observed_at":"2026-08-07T14:25:44.171851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.150811Z","title":"Ni, and Heung-Yeung Shum","venue":null,"work_id":"226bfcfd-5688-46ae-98bd-e60c8d1c467a","year":2023},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.947653Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:ede2297f0d5ee98bf43a2a00e20b81656a582b8d431b070bb68564201cb66982","observation_id":"e33a2214-f781-4e90-92e1-5313eccf1022","resolution":{"observed_at":"2026-08-07T14:25:44.155459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.134407Z","title":"Llava-grounding: Grounded visual chat with large multimodal models","venue":null,"work_id":"4f43b091-9eba-4b71-a94b-e9d1d8910b38","year":2024},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.953447Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:a31eb328c191c1dd56d23b373ea092306d1e0b87df82ae23f6fda564c8591fd0","observation_id":"bf19aa99-7d41-4b33-830f-9a967b0586c9","resolution":{"observed_at":"2026-08-07T14:25:44.140375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.116586Z","title":"Glipv2: Unifying localization and vision-language understanding","venue":null,"work_id":"ebce6405-3c48-4a84-9e9b-eb7991f6c315","year":2022},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.959038Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:1f78bc4ddebef6b6f315bf7a50401abafb1133a46ac03df304328e24e985d3c7","observation_id":"a910885d-f952-4053-a270-93fbdc12f077","resolution":{"observed_at":"2026-08-07T14:25:44.123477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T01:36:24.150512Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":32},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 7 inbound Pith citation observations for arXiv:2505.18986."}