{"as_of":"2026-08-14T14:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dd0343e495d24c2a1c0c4193ca673b053f9ccb5eb6cc2bc7bd366ef529150b0c","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T10:58:35.439139Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.24598/citation-record","integrity":"/paper/2607.24598/integrity","json":"/paper/2607.24598/citation-record.json","paper":"/paper/2607.24598"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:33.307255Z","title":"End-to-end object detection with transformers,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-08T23:42:30.391707Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:33.307255Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:3b3b2c8baa1aec1147266bbd1d82dc6454e143acbc2f0c2dc1d4b38e5edaf5f3","observation_id":"9c6e4cba-285d-4aca-9f4f-69d2451f5679","resolution":{"observed_at":"2026-07-31T10:58:33.307255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:33.372720Z","title":"Masked-attention mask transformer for universal image segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-08T23:42:30.391707Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:33.372720Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:d8ca703e7f54c645c5585d0a4715b03f3e203dab647c3439f03973e5551c5428","observation_id":"783767c4-e0a9-41eb-8d43-9dc6540b20bc","resolution":{"observed_at":"2026-07-31T10:58:33.372720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:33.442996Z","title":"Seq- former: Sequential transformer for video instance seg- mentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-08T23:42:30.391707Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:33.442996Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:fbc822c092cff3149c6d3ba13baf7df4987d19280af3f54e9aa5bb5c704e99d1","observation_id":"c0dffed0-01e2-4cd8-991a-8f1d2156eda3","resolution":{"observed_at":"2026-07-31T10:58:33.442996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:33.507883Z","title":"In defense of online models for video instance segmen- tation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-08T23:42:30.391707Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:33.507883Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:d96a9b194732f266ac4c5117847d03d55c6c6aaecd77caec89c43741b519c6d1","observation_id":"edab6910-923a-4518-829d-456e7422eb8a","resolution":{"observed_at":"2026-07-31T10:58:33.507883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:33.563503Z","title":"Visage: Video instance segmentation with appearance-guided enhancement,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-08T23:42:30.391707Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:33.563503Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:69dca28fced6e98303419b85689ecd5acd36092264e8a98b1f152364b98c0f57","observation_id":"f6140898-49e4-45a2-89e1-0776227811ac","resolution":{"observed_at":"2026-07-31T10:58:33.563503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:33.635832Z","title":"Minvis: A minimal video instance segmentation framework without video-based training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-08T23:42:30.391707Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:33.635832Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:9705ac6242aafeaaa8a6f5c50eb8ecc6d7d3c089b15b69abb1ac3bddd7b0cb9a","observation_id":"cad1075c-6918-4e50-b9af-4f7feefa43ae","resolution":{"observed_at":"2026-07-31T10:58:33.635832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:33.705270Z","title":"A generalized framework for video instance segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-08T23:42:30.391707Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:33.705270Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:9f531a59e25c940be5f54b1fec1c9ab12fc9ab9cf98d7e2515bbf96e8abc3a1d","observation_id":"0638f34a-3217-4976-9a95-1cf2a0de0319","resolution":{"observed_at":"2026-07-31T10:58:33.705270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:33.789588Z","title":"Tcovis: Tempo- rally consistent online video instance segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-08T23:42:30.391707Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:33.789588Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:55beb82858170ff40b904cb5cfa28bcfd5fad657e391926be4a1822b613ea500","observation_id":"9954900b-112e-4a4f-9718-3aaf940cf07a","resolution":{"observed_at":"2026-07-31T10:58:33.789588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:33.869090Z","title":"Dvis: Decoupled video instance segmentation framework,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-08T23:42:30.391707Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:33.869090Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:864f80da302cfe6687b38a8d98865df3fa2e64907dc45e070b6b190b180dfafb","observation_id":"badad673-7af7-42ad-b5f5-5b0db16e7ccb","resolution":{"observed_at":"2026-07-31T10:58:33.869090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:33.931745Z","title":"Cavis: Context-aware video instance segmentation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-08T23:42:30.391707Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:33.931745Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:641bce6de22248a899ea0419fcb5ac6c9ad4d84de261970e7c9202907f477500","observation_id":"c0cd4b19-15fb-4dc5-89f2-9b1ab9a4ef37","resolution":{"observed_at":"2026-07-31T10:58:33.931745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:34.010812Z","title":"Lidar-camera fusion for video panoptic segmentation without video training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-08T23:42:30.391707Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:34.010812Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:bf76f493b2cfa8b54c812adf913827c02878ed09d6228b1a7bd5a71eab44bcc2","observation_id":"c2a5ba52-1077-4d4e-a978-98dde57fd80a","resolution":{"observed_at":"2026-07-31T10:58:34.010812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.07394","last_updated":"2026-06-05T15:32:48Z","snapshot_observed_at":"2026-08-02T20:31:00.881598Z","submitted_at":"2026-06-05T15:32:48Z","title":"Mind the Gap: Disentangling Performance Bottlenecks in Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.07394","snapshot_observed_at":"2026-07-31T10:58:34.054265Z","title":"Mind the gap: Disentangling performance bottlenecks in video instance segmentation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-08T23:42:30.391707Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:34.054265Z"},"links":{"cited_paper":"/paper/2606.07394","citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:37293b53115d7980a1711e10918aa1b94375aabac3d367d401951652a1b9e046","observation_id":"9247b755-fd73-4a75-b7a3-067759679792","resolution":{"observed_at":"2026-07-31T10:58:34.054265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:34.159602Z","title":"Per-pixel classification is not all you need for semantic segmen- tation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-08T23:42:30.391707Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:34.159602Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:398cff3b26095a8500e613ec92ab25ed1fea2f6a1da83b989ca884cd891cc073","observation_id":"100d4823-7740-47bb-b767-03d1f9bd81aa","resolution":{"observed_at":"2026-07-31T10:58:34.159602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:34.218847Z","title":"Video instance segmen- tation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-08T23:42:30.391707Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:34.218847Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:66ae3219413d3fdfc5b5d91d7bde5a9492e256b5dc280199faf19587f1f5d45e","observation_id":"068634c6-7b7c-4737-8d88-a5f282de9e9b","resolution":{"observed_at":"2026-07-31T10:58:34.218847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:34.280427Z","title":"Crossover learning for fast on- line video instance segmentation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-08T23:42:30.391707Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:34.280427Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:715d7b4cdebe36c46669ad38b85754025aee876e2e00816eb8842266fa9362da","observation_id":"a9d0b735-d0e4-4712-ab2a-c591dbf00c07","resolution":{"observed_at":"2026-07-31T10:58:34.280427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:34.363325Z","title":"VidEoMT: Your ViT is secretly also a video segmentation model,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-08T23:42:30.391707Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:34.363325Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:182ea2a88b9df760f784d436dbbddaf5a10acc268fd8ba80f66e95d7c8b2a1aa","observation_id":"c17f4dd9-4c37-4692-87e0-ac930d6af10e","resolution":{"observed_at":"2026-07-31T10:58:34.363325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.15266","last_updated":"2023-09-18T14:46:11Z","snapshot_observed_at":"2026-08-13T10:25:00.851056Z","submitted_at":"2023-08-29T12:51:04Z","title":"NOVIS: A Case for End-to-End Near-Online Video Instance Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.15266","snapshot_observed_at":"2026-07-31T10:58:34.447852Z","title":"NOVIS: A case for end-to-end near- online video instance segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-08T23:42:30.391707Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:34.447852Z"},"links":{"cited_paper":"/paper/2308.15266","citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:2be11f4d5872e113456a056a88c16c9f3b4ca799c891b9f192c77382ad897a3d","observation_id":"22ed96f8-91dd-426a-8984-e0eb69d43288","resolution":{"observed_at":"2026-07-31T10:58:34.447852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:34.511329Z","title":"Efficient video instance segmentation via tracklet query and proposal,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-08T23:42:30.391707Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:34.511329Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:145a48f10e029b2fe137e3b4e14392feb9f187555877a3dc131fbd59ea25307b","observation_id":"4e50b678-002c-4c99-a734-38665b8b0936","resolution":{"observed_at":"2026-07-31T10:58:34.511329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:34.582870Z","title":"Ctvis: Con- sistent training for online video instance segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-08T23:42:30.391707Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:34.582870Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:05a6c0d7513f5b9ffb08e071305d915aa49da249f3adebe17744d7016eabb8ed","observation_id":"376b6020-655d-4a71-a00a-60b124afbe09","resolution":{"observed_at":"2026-07-31T10:58:34.582870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:34.642651Z","title":"Visolo: Grid-based space-time aggregation for efficient online video instance segmen- tation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-08T23:42:30.391707Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:34.642651Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:ecdefee660f7fca83fa04f2e3b554f114ff0d911d621757edde7126ed5b33fb2","observation_id":"aec835aa-2eb4-48a1-b5c0-7bc7de1e8713","resolution":{"observed_at":"2026-07-31T10:58:34.642651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:34.726895Z","title":"Video instance segmentation using inter-frame communication transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-08T23:42:30.391707Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:34.726895Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:034df9a2bf2718a074edb275691341491fd12b2681da8126e92d01f57dc6db2c","observation_id":"155011e5-32a2-4ef7-99fc-81067040a24b","resolution":{"observed_at":"2026-07-31T10:58:34.726895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:34.799758Z","title":"Vita: Video instance segmentation via object token as- sociation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-08T23:42:30.391707Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:34.799758Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:bb55a2e14930a00fc566c2f1db7c9afb89ee7ecd51bd3004d2992198fa1b8326","observation_id":"d3b9db15-e4bd-4960-bba9-83afd1863d99","resolution":{"observed_at":"2026-07-31T10:58:34.799758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:34.891287Z","title":"Mdqe: Mining discriminative query embeddings to segment occluded instances on challenging videos,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-08T23:42:30.391707Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:34.891287Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:a0f580df1f45d2728baa9b5f76ec95f25a682662e525550a2cfd5dd5b49146f0","observation_id":"0354a5dc-b080-4a62-95e4-80c988c608f8","resolution":{"observed_at":"2026-07-31T10:58:34.891287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04774","last_updated":"2023-06-07T20:45:15Z","snapshot_observed_at":"2026-08-13T15:39:28.700598Z","submitted_at":"2023-06-07T20:45:15Z","title":"RefineVIS: Video Instance Segmentation with Temporal Attention Refinement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04774","snapshot_observed_at":"2026-07-31T10:58:34.951024Z","title":"Re- finevis: Video instance segmentation with temporal at- tention refinement,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-08T23:42:30.391707Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:34.951024Z"},"links":{"cited_paper":"/paper/2306.04774","citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:2264e1cb62174d271d720cd32728e0c5fef266cc737b510f68c502370982b385","observation_id":"e5de03ed-1e0f-47e5-ae34-c6a97b1eb35d","resolution":{"observed_at":"2026-07-31T10:58:34.951024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:35.035346Z","title":"Sipmask: Spatial information preserva- tion for fast image and video instance segmentation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-08T23:42:30.391707Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:35.035346Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:66d434a10a73176a9e66df85ab45e0ec36a8292518b602602357dd414de50c75","observation_id":"17a2e83c-953a-4dba-8d55-d63ea0e2a943","resolution":{"observed_at":"2026-07-31T10:58:35.035346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:35.125591Z","title":"The 3rd large-scale video object segmentation challenge – video instance segmentation track,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-08T23:42:30.391707Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:35.125591Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:c99861c774ec91839666cc6bdaa092a2975c20ac5c22b43cc1cb22b9ee51af75","observation_id":"f8e80bae-a73d-4ca3-95fa-7a52c568836e","resolution":{"observed_at":"2026-07-31T10:58:35.125591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:35.208422Z","title":"The 4th large-scale video object segmentation challenge – video instance segmen- tation track,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-08T23:42:30.391707Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:35.208422Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:9f6e02750c16a791b2fb5620ee0fd63440f458ebf79897bcf2787dda404bee82","observation_id":"922e9a2f-485a-45ab-beaa-8a7c8b28af4b","resolution":{"observed_at":"2026-07-31T10:58:35.208422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:35.271268Z","title":"Occluded video instance segmentation: A benchmark,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-08T23:42:30.391707Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:35.271268Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:98757b729d17051e76d0074cb0be2b67d2e3810c50d598687c687beb4b249820","observation_id":"7ae57f54-e54a-4939-9c06-01c6aad4d1af","resolution":{"observed_at":"2026-07-31T10:58:35.271268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:35.332254Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-08T23:42:30.391707Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:35.332254Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:872ef2ea2dbca9129f7d57c8ef318d6ff36acb212aca8402405051f1f5586294","observation_id":"3728bd47-4a74-4f14-b168-7c54bacd48ab","resolution":{"observed_at":"2026-07-31T10:58:35.332254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:35.384836Z","title":"Relational knowledge distillation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-08T23:42:30.391707Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:35.384836Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:117cbd81f57e79ab4050bfbf2aca94f60ade31d3ed585906443ccc6b0a038b6f","observation_id":"ae20e517-4a34-4748-93a3-674d923c2d0e","resolution":{"observed_at":"2026-07-31T10:58:35.384836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:58:35.439139Z","title":"Swin Transformer: Hierarchical vision transformer using shifted windows,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","snapshot_observed_at":"2026-08-08T23:42:30.391707Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T10:58:35.439139Z"},"links":{"citing_paper":"/paper/2607.24598"},"observation_digest":"sha256:12bdf018fb226b6d8fd99662b4259bf0809c2ad3c28ef9eb4961fd9ff209e800","observation_id":"9232720a-19e8-49ae-ac86-dfb4d3afc8b9","resolution":{"observed_at":"2026-07-31T10:58:35.439139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.24598","last_updated":"2026-07-27T16:00:03Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T23:42:30.391707Z","submitted_at":"2026-07-27T16:00:03Z","title":"QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2607.24598."}