{"as_of":"2026-08-09T20:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5ad5678628e77322597526055f24870f33c79d8a54de45fba6595120406cc59b","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":20,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:25:44.060493Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T03:06:43.601051Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":"2112.10764","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-07-10T03:06:43.601051Z","title":"Mask2former for video instance segmentation","venue":"cs.CV","work_id":"b1131c21-30c6-499a-a423-eef12442cb11","year":2021},"citing_paper":{"arxiv_id":"2503.01835","last_updated":"2026-04-30T12:56:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T18:56:29Z","title":"Primus: Enforcing Attention Usage for 3D Medical Image Segmentation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-23T01:22:29.901174Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2503.01835"},"observation_digest":"sha256:7de8a98044b487f0697a82355cb25c8e15d917c3c3b09943f83e95498987675d","observation_id":"164a91ab-6c2d-4928-8067-bfaaf7be41f5","resolution":{"observed_at":"2026-05-23T01:25:16.506146Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-08-07T05:25:44.060493Z","title":"Mask2former for video instance segmentation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07977","last_updated":"2025-06-26T15:47:09Z","snapshot_observed_at":"2026-08-09T14:38:22.529752Z","submitted_at":"2025-06-09T17:50:21Z","title":"OneIG-Bench: Omni-dimensional Nuanced Evaluation for Image Generation","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:44.060493Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2506.07977"},"observation_digest":"sha256:3205744ed48e5b4b9c22295c49aef830c4f5355c6314d8a2cab730891db56a53","observation_id":"10f86999-c4bc-44b4-bc1c-5005dc1bc195","resolution":{"observed_at":"2026-08-07T05:25:44.060493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-08-06T23:50:23.286782Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16058","last_updated":"2025-06-24T03:11:42Z","snapshot_observed_at":"2026-08-09T19:02:44.572155Z","submitted_at":"2025-06-19T06:32:53Z","title":"Stepping Out of Similar Semantic Space for Open-Vocabulary Segmentation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.286782Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2506.16058"},"observation_digest":"sha256:621204dcc2d8bddc347bd6782b9071e1b1826f2d0f0b1d23951a6d6b13455082","observation_id":"cab951f1-9f45-4213-978b-f68eea78264e","resolution":{"observed_at":"2026-08-06T23:50:23.286782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-08-06T19:21:13.164766Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.05887","last_updated":"2025-07-18T12:41:26Z","snapshot_observed_at":"2026-08-07T20:54:26.650929Z","submitted_at":"2025-07-08T11:21:03Z","title":"GeoMag: A Vision-Language Model for Pixel-level Fine-Grained Remote Sensing Image Parsing","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:13.164766Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2507.05887"},"observation_digest":"sha256:cf007e2cbb96bbb840951edbcf03157f789c68bbf32dcc37be01ef2686ee51c9","observation_id":"87b8979b-f055-487d-850c-6ce6b719beea","resolution":{"observed_at":"2026-08-06T19:21:13.164766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-08-06T19:17:31.737828Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.05948","last_updated":"2025-07-14T08:43:38Z","snapshot_observed_at":"2026-08-07T21:46:08.987907Z","submitted_at":"2025-07-08T12:44:49Z","title":"Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:31.737828Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2507.05948"},"observation_digest":"sha256:f874968206a5660ae638b43ad9526d52237ccd657f439c32c4c12f4ebd361ce5","observation_id":"bd7d29b2-c6db-4d8c-b6fc-7cec9ca92856","resolution":{"observed_at":"2026-08-06T19:17:31.737828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-08-06T14:37:32.089540Z","title":", author Choudhuri, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.18330","last_updated":"2025-07-25T17:32:47Z","snapshot_observed_at":"2026-08-09T12:49:25.032048Z","submitted_at":"2025-07-24T11:57:59Z","title":"GVCCS: A Dataset for Contrail Identification and Tracking on Visible Whole Sky Camera Sequences","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T14:37:32.089540Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2507.18330"},"observation_digest":"sha256:513e89b67bedd757ce3628121f25d10d9d33733414cfe3e2b9611e8c85ac5202","observation_id":"d6d28bd7-fe06-4d42-8334-568ec688b40d","resolution":{"observed_at":"2026-08-06T14:37:32.089540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-08-06T14:22:13.254653Z","title":"Mask2former for video instance segmentation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.19451","last_updated":"2025-08-02T16:10:54Z","snapshot_observed_at":"2026-08-09T02:33:58.088487Z","submitted_at":"2025-07-25T17:33:23Z","title":"GS-Occ3D: Scaling Vision-only Occupancy Reconstruction with Gaussian Splatting","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T14:22:13.254653Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2507.19451"},"observation_digest":"sha256:a3c503c57131fe47b422f59f059982e53c23bb09812a03089c4ef488012cd40d","observation_id":"2489c505-f001-449f-97bc-6756f5153e56","resolution":{"observed_at":"2026-08-06T14:22:13.254653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-08-06T14:08:43.698403Z","title":"Mask2former for video instance segmentation.arXiv preprint arXiv:2112.10764, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.19754","last_updated":"2025-07-26T02:52:41Z","snapshot_observed_at":"2026-08-08T04:35:57.774441Z","submitted_at":"2025-07-26T02:52:41Z","title":"Latest Object Memory Management for Temporally Consistent Video Instance Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T14:08:43.698403Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2507.19754"},"observation_digest":"sha256:b6d7bcb9246122161776f5fe3318df101a31e335f4daaf6819b543a83a3e669b","observation_id":"c6ff474e-4aed-44d8-83bf-b09ba6be3630","resolution":{"observed_at":"2026-08-06T14:08:43.698403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-08-05T23:11:37.909813Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.05851","last_updated":"2025-08-07T20:52:49Z","snapshot_observed_at":"2026-08-08T07:03:05.959929Z","submitted_at":"2025-08-07T20:52:49Z","title":"Temporal Cluster Assignment for Efficient Real-Time Video Segmentation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T23:11:37.909813Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2508.05851"},"observation_digest":"sha256:ca919c6acb57a6d4b5e4527a7a508b7ae757873ad90c4009ac9ac1d17d7fc934","observation_id":"6f339dd2-819a-4472-a54d-7544ee0bdf16","resolution":{"observed_at":"2026-08-05T23:11:37.909813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-08-05T21:35:35.401431Z","title":"Mask2former for video instance segmentation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.08498","last_updated":"2025-08-11T22:08:57Z","snapshot_observed_at":"2026-08-06T05:37:01.585501Z","submitted_at":"2025-08-11T22:08:57Z","title":"CObL: Toward Zero-Shot Ordinal Layering without User Prompting","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T21:35:35.401431Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2508.08498"},"observation_digest":"sha256:7d106e07a46bc5bae09d4bd9a842a8da850c7ae46081b825d7aeb7c61a84b197","observation_id":"a89c39a0-f55f-4a9b-8ba0-b528648f14c8","resolution":{"observed_at":"2026-08-05T21:35:35.401431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-08-05T20:30:02.984463Z","title":"Mask2former for video instance segmentation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10430","last_updated":"2025-08-14T08:02:54Z","snapshot_observed_at":"2026-08-08T14:23:37.423987Z","submitted_at":"2025-08-14T08:02:54Z","title":"Interleaved Transceiver Design for a Continuous- Transmission MIMO-OFDM ISAC System","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:02.984463Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2508.10430"},"observation_digest":"sha256:e13fd25e02540dcd429f5cdf8769ec34d87307edfe062e372f4edaf8615c0aee","observation_id":"453aadd4-07b8-4fe4-8e23-54c911b8f2fb","resolution":{"observed_at":"2026-08-05T20:30:02.984463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-08-05T15:33:15.913482Z","title":"Mask2former for video instance segmentation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.19808","last_updated":"2025-08-27T11:52:41Z","snapshot_observed_at":"2026-08-09T12:55:31.874911Z","submitted_at":"2025-08-27T11:52:41Z","title":"AutoQ-VIS: Improving Unsupervised Video Instance Segmentation via Automatic Quality Assessment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T15:33:15.913482Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2508.19808"},"observation_digest":"sha256:cf31665f72ce0551d29ea45de097f40945d5d891d8df4ab69f7058a8ecdee2e1","observation_id":"500da900-2e9b-4573-94d9-6a9d882cd9a5","resolution":{"observed_at":"2026-08-05T15:33:15.913482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-08-04T09:31:55.211242Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.14904","last_updated":"2026-06-01T09:12:30Z","snapshot_observed_at":"2026-08-07T08:43:42.486523Z","submitted_at":"2025-10-16T17:20:22Z","title":"CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T09:31:55.211242Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2510.14904"},"observation_digest":"sha256:978f363b8b89bae7a881186e54c4021138ea5ba5daff2b8d5cfbfea5ec6fa700","observation_id":"10c61aa5-734c-4aec-b0a5-643ae63bd371","resolution":{"observed_at":"2026-08-04T09:31:55.211242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":"2112.10764","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-07-10T03:06:43.601051Z","title":"Mask2former for video instance segmentation","venue":"cs.CV","work_id":"b1131c21-30c6-499a-a423-eef12442cb11","year":2021},"citing_paper":{"arxiv_id":"2604.13294","last_updated":"2026-04-30T06:11:12Z","snapshot_observed_at":"2026-07-06T23:01:19.191464Z","submitted_at":"2026-04-14T20:55:17Z","title":"PAT-VCM: Plug-and-Play Auxiliary Tokens for Video Coding for Machines","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T15:45:09.913980Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2604.13294"},"observation_digest":"sha256:4c885780f4598c34e419fb65c47068f57025db7e1a3d778e8f3020b162e131da","observation_id":"be6a2d55-45cc-495b-a708-0f4ef7620b64","resolution":{"observed_at":"2026-05-11T09:56:01.846052Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":"2112.10764","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-07-10T03:06:43.601051Z","title":"Mask2former for video instance segmentation","venue":"cs.CV","work_id":"b1131c21-30c6-499a-a423-eef12442cb11","year":2021},"citing_paper":{"arxiv_id":"2604.19411","last_updated":"2026-04-21T12:39:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-21T12:39:41Z","title":"GOLD-BEV: GrOund and aeriaL Data for Dense Semantic BEV Mapping of Dynamic Scenes","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T03:20:24.032405Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2604.19411"},"observation_digest":"sha256:cbe7c8027d888ac15e565fc19a3c0146fd666fce633490630663076046f3dddd","observation_id":"adf30736-1412-4539-9207-ce3599cc819d","resolution":{"observed_at":"2026-05-11T12:41:01.637082Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":"2112.10764","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-07-10T03:06:43.601051Z","title":"Mask2former for video instance segmentation","venue":"cs.CV","work_id":"b1131c21-30c6-499a-a423-eef12442cb11","year":2021},"citing_paper":{"arxiv_id":"2606.07394","last_updated":"2026-06-05T15:32:48Z","snapshot_observed_at":"2026-08-02T20:31:00.881598Z","submitted_at":"2026-06-05T15:32:48Z","title":"Mind the Gap: Disentangling Performance Bottlenecks in Video Instance Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:36.011508Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2606.07394"},"observation_digest":"sha256:77dfedc940f419070380965ee423745039d85817272f9115717ceb1c3b7d9ff0","observation_id":"fc1c1c04-981c-4149-8ea9-74bbae5d0e56","resolution":{"observed_at":"2026-07-02T17:07:12.925722Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":"2112.10764","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-07-10T03:06:43.601051Z","title":"Mask2former for video instance segmentation","venue":"cs.CV","work_id":"b1131c21-30c6-499a-a423-eef12442cb11","year":2021},"citing_paper":{"arxiv_id":"2606.20140","last_updated":"2026-06-29T11:14:49Z","snapshot_observed_at":"2026-08-09T15:03:59.427019Z","submitted_at":"2026-06-18T12:03:04Z","title":"SA-VIS: Sparse frame Annotations for training Video Instance Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T18:19:56.997875Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2606.20140"},"observation_digest":"sha256:ea3809f807b99185e48db17802ef384aa7b1b0b848503c243f5efe23b6fdb94c","observation_id":"7f9d0ede-c8c2-4449-8697-5369740011c7","resolution":{"observed_at":"2026-07-04T03:09:30.493585Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":"2112.10764","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-07-10T03:06:43.601051Z","title":"Mask2former for video instance segmentation","venue":"cs.CV","work_id":"b1131c21-30c6-499a-a423-eef12442cb11","year":2021},"citing_paper":{"arxiv_id":"2606.20140","last_updated":"2026-06-29T11:14:49Z","snapshot_observed_at":"2026-08-09T15:03:59.427019Z","submitted_at":"2026-06-18T12:03:04Z","title":"SA-VIS: Sparse frame Annotations for training Video Instance Segmentation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T10:45:35.568212Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2606.20140"},"observation_digest":"sha256:9dcf7d4a5642fff27d9b10e44f0918d790f8d3498ad5ceed602c877ad65c260e","observation_id":"46758175-4b06-49e8-a5a7-1e1fe1319b2f","resolution":{"observed_at":"2026-06-30T10:54:37.012591Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":"2112.10764","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-07-10T03:06:43.601051Z","title":"Mask2former for video instance segmentation","venue":"cs.CV","work_id":"b1131c21-30c6-499a-a423-eef12442cb11","year":2021},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-05T21:36:20.633854Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:b0177c0ed1fa46bd86e594204295b35c71a5d178674ac9bbc88939f873ca0760","observation_id":"aacbb5a3-64a2-4e90-bd87-ffdedc95b691","resolution":{"observed_at":"2026-07-10T03:06:43.602664Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-08-05T22:20:46.977826Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:46.977826Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:00bb2de4c5ff200fe97de308c51e7fe27c918247d9b66f5a2f6eddb457bbfd4a","observation_id":"c631030b-3c73-4f78-a06e-796a12b477db","resolution":{"observed_at":"2026-08-05T22:20:46.977826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2112.10764/citation-record","integrity":"/paper/2112.10764/integrity","json":"/paper/2112.10764/citation-record.json","paper":"/paper/2112.10764"},"outbound":[],"paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 20 inbound Pith citation observations for arXiv:2112.10764."}