{"as_of":"2026-08-10T01:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fab2e012feea70c2d474595d78b34aacbe9442b4cb8cf49470b0ad88645a5cd6","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:56:03.635888Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T14:48:32.402938Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2112.03857","last_updated":"2022-06-17T10:32:21Z","snapshot_observed_at":"2026-07-06T12:16:15.735863Z","submitted_at":"2021-12-07T17:47:50Z","title":"Grounded Language-Image Pre-training","version":2},"cited_work":{"arxiv_id":"2112.03857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.03857","snapshot_observed_at":"2026-07-03T14:48:32.402938Z","title":"Grounded language-image pre-training","venue":null,"work_id":"494303c9-754a-4a32-ad24-01c46aa2a202","year":2022},"citing_paper":{"arxiv_id":"2203.03605","last_updated":"2022-07-11T10:30:29Z","snapshot_observed_at":"2026-08-07T03:38:32.486362Z","submitted_at":"2022-03-07T18:55:26Z","title":"DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T19:53:25.499901Z"},"links":{"cited_paper":"/paper/2112.03857","citing_paper":"/paper/2203.03605"},"observation_digest":"sha256:ddc1b924f7587417c6e241c18af6650a5424519f7b608b04782fd8538e77881e","observation_id":"86f17117-d3bc-48a2-91f2-640f9d3e1395","resolution":{"observed_at":"2026-05-12T19:53:25.615542Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.03857","last_updated":"2022-06-17T10:32:21Z","snapshot_observed_at":"2026-07-06T12:16:15.735863Z","submitted_at":"2021-12-07T17:47:50Z","title":"Grounded Language-Image Pre-training","version":2},"cited_work":{"arxiv_id":"2112.03857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.03857","snapshot_observed_at":"2026-07-03T14:48:32.402938Z","title":"Grounded language-image pre-training","venue":null,"work_id":"494303c9-754a-4a32-ad24-01c46aa2a202","year":2022},"citing_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-11T11:11:36.847364Z"},"links":{"cited_paper":"/paper/2112.03857","citing_paper":"/paper/2303.05499"},"observation_digest":"sha256:63115347b48310dce07994b5e5272b22f6e56d04ac8e7f03f251a2c07f4ae0d2","observation_id":"6bb2a822-2dd6-4d1f-9f61-118a475adaa1","resolution":{"observed_at":"2026-05-11T11:11:37.002347Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.03857","last_updated":"2022-06-17T10:32:21Z","snapshot_observed_at":"2026-07-06T12:16:15.735863Z","submitted_at":"2021-12-07T17:47:50Z","title":"Grounded Language-Image Pre-training","version":2},"cited_work":{"arxiv_id":"2112.03857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.03857","snapshot_observed_at":"2026-07-03T14:48:32.402938Z","title":"Grounded language-image pre-training","venue":null,"work_id":"494303c9-754a-4a32-ad24-01c46aa2a202","year":2022},"citing_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-07T17:54:54.749604Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T19:47:29.252026Z"},"links":{"cited_paper":"/paper/2112.03857","citing_paper":"/paper/2308.06571"},"observation_digest":"sha256:af04652a44059f3504fe40c3edc11fa66304a0442f4ebd75061de04281ed202f","observation_id":"aa0acacf-0303-4e8c-9f62-adc4666fde93","resolution":{"observed_at":"2026-05-12T19:47:29.431343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.03857","last_updated":"2022-06-17T10:32:21Z","snapshot_observed_at":"2026-07-06T12:16:15.735863Z","submitted_at":"2021-12-07T17:47:50Z","title":"Grounded Language-Image Pre-training","version":2},"cited_work":{"arxiv_id":"2112.03857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.03857","snapshot_observed_at":"2026-07-03T14:48:32.402938Z","title":"Grounded language-image pre-training","venue":null,"work_id":"494303c9-754a-4a32-ad24-01c46aa2a202","year":2022},"citing_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T17:54:03.225439Z"},"links":{"cited_paper":"/paper/2112.03857","citing_paper":"/paper/2503.20215"},"observation_digest":"sha256:fb1230461590ea3211517f534f52f7518a7052fa1b205ab97f5d39ada5b597f1","observation_id":"21c500b0-dcb6-4b5b-9e6f-71304dbc628b","resolution":{"observed_at":"2026-05-10T17:54:03.392121Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.03857","last_updated":"2022-06-17T10:32:21Z","snapshot_observed_at":"2026-07-06T12:16:15.735863Z","submitted_at":"2021-12-07T17:47:50Z","title":"Grounded Language-Image Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.03857","snapshot_observed_at":"2026-08-06T17:56:03.635888Z","title":"Grounded Language-Image Pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09562","last_updated":"2025-07-13T10:10:17Z","snapshot_observed_at":"2026-08-09T15:24:35.785392Z","submitted_at":"2025-07-13T10:10:17Z","title":"Prompt Engineering in Segment Anything Model: Methodologies, Applications, and Emerging Challenges","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:56:03.635888Z"},"links":{"cited_paper":"/paper/2112.03857","citing_paper":"/paper/2507.09562"},"observation_digest":"sha256:959a9b999cf9ed7d65e0a8f3a7681c3ee4464cfd985305a2a8ffe04051c6afe5","observation_id":"88b9d180-4932-4cf0-aa7f-acb343543d6e","resolution":{"observed_at":"2026-08-06T17:56:03.635888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.03857","last_updated":"2022-06-17T10:32:21Z","snapshot_observed_at":"2026-07-06T12:16:15.735863Z","submitted_at":"2021-12-07T17:47:50Z","title":"Grounded Language-Image Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.03857","snapshot_observed_at":"2026-08-04T13:27:41.049003Z","title":"Grounded language-image pre-training, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.00458","last_updated":"2026-07-02T20:01:06Z","snapshot_observed_at":"2026-08-08T08:04:03.105176Z","submitted_at":"2025-10-01T03:17:56Z","title":"VLOD-TTA: Test-Time Adaptation of Vision-Language Object Detectors","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T13:27:41.049003Z"},"links":{"cited_paper":"/paper/2112.03857","citing_paper":"/paper/2510.00458"},"observation_digest":"sha256:49055e9fb312c0dfcfdfe46d7f4055ccc1e07dce3bb4761cd162ba2a8dfa11b7","observation_id":"d4062fe0-24b2-4e5a-b399-703b44b10853","resolution":{"observed_at":"2026-08-04T13:27:41.049003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.03857","last_updated":"2022-06-17T10:32:21Z","snapshot_observed_at":"2026-07-06T12:16:15.735863Z","submitted_at":"2021-12-07T17:47:50Z","title":"Grounded Language-Image Pre-training","version":2},"cited_work":{"arxiv_id":"2112.03857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.03857","snapshot_observed_at":"2026-07-03T14:48:32.402938Z","title":"Grounded language-image pre-training","venue":null,"work_id":"494303c9-754a-4a32-ad24-01c46aa2a202","year":2022},"citing_paper":{"arxiv_id":"2604.11042","last_updated":"2026-04-13T06:14:20Z","snapshot_observed_at":"2026-07-06T22:59:32.051572Z","submitted_at":"2026-04-13T06:14:20Z","title":"Improving Layout Representation Learning Across Inconsistently Annotated Datasets via Agentic Harmonization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T16:28:16.315767Z"},"links":{"cited_paper":"/paper/2112.03857","citing_paper":"/paper/2604.11042"},"observation_digest":"sha256:9f4fd6d7eb2894bb52c5c890aa93a96a51ccde4746f6a7d9ee74d0d775e9209b","observation_id":"82fa369c-e229-4011-b097-3e77bb0bb4dd","resolution":{"observed_at":"2026-05-11T08:50:58.396639Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.03857","last_updated":"2022-06-17T10:32:21Z","snapshot_observed_at":"2026-07-06T12:16:15.735863Z","submitted_at":"2021-12-07T17:47:50Z","title":"Grounded Language-Image Pre-training","version":2},"cited_work":{"arxiv_id":"2112.03857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.03857","snapshot_observed_at":"2026-07-03T14:48:32.402938Z","title":"Grounded language-image pre-training","venue":null,"work_id":"494303c9-754a-4a32-ad24-01c46aa2a202","year":2022},"citing_paper":{"arxiv_id":"2607.02484","last_updated":"2026-07-02T17:50:57Z","snapshot_observed_at":"2026-07-07T00:07:56.573640Z","submitted_at":"2026-07-02T17:50:57Z","title":"Combating Textual Noise and Redundancy: Entropy-Aware Dense Visual Token Pruning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-03T14:47:35.377391Z"},"links":{"cited_paper":"/paper/2112.03857","citing_paper":"/paper/2607.02484"},"observation_digest":"sha256:a220d9fc5db694828a76cad56074060fef7b9848f0cb9d67cc9bca29eeb81e5d","observation_id":"a3fda91e-4579-49fd-83b4-957e2ab7d4a4","resolution":{"observed_at":"2026-07-03T14:48:32.404466Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.03857","last_updated":"2022-06-17T10:32:21Z","snapshot_observed_at":"2026-07-06T12:16:15.735863Z","submitted_at":"2021-12-07T17:47:50Z","title":"Grounded Language-Image Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.03857","snapshot_observed_at":"2026-08-06T17:14:44.905839Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04766","last_updated":"2026-08-05T12:33:07Z","snapshot_observed_at":"2026-08-09T21:50:58.389387Z","submitted_at":"2026-08-05T12:33:07Z","title":"FUSEP: A Multi-Center Benchmark for Diverse Tasks in Early Pregnancy Fetal Ultrasound Screening","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:14:44.905839Z"},"links":{"cited_paper":"/paper/2112.03857","citing_paper":"/paper/2608.04766"},"observation_digest":"sha256:4776300b3c03c14f907e79a5138ae6e1acc23e55c8378a79583f66330e2e852e","observation_id":"59b2b48a-f871-464f-a8c8-3b16ce57a593","resolution":{"observed_at":"2026-08-06T17:14:44.905839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2112.03857/citation-record","integrity":"/paper/2112.03857/integrity","json":"/paper/2112.03857/citation-record.json","paper":"/paper/2112.03857"},"outbound":[],"paper":{"arxiv_id":"2112.03857","last_updated":"2022-06-17T10:32:21Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T12:16:15.735863Z","submitted_at":"2021-12-07T17:47:50Z","title":"Grounded Language-Image Pre-training"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 9 inbound Pith citation observations for arXiv:2112.03857."}