{"as_of":"2026-08-09T23:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fc9893828deecc9aab3fda53cc01c974a7e717ed6ab0d80bc40c273b30df52ae","coverage":[{"denominator":221,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:34:12.008044Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.13552/citation-record","integrity":"/paper/2506.13552/integrity","json":"/paper/2506.13552/citation-record.json","paper":"/paper/2506.13552"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:59.162092Z","title":"Fully convolutional networks for semantic segmentation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:59.162092Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:de11628b567b1b3d3a949b31278aaeb58f70354e92b303cfc682e56bc28b1dc0","observation_id":"84687d9c-875f-4567-8128-0f62135c15fa","resolution":{"observed_at":"2026-08-07T00:33:59.162092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:59.259043Z","title":"Deep feature flow for video recognition,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:59.259043Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:cb6b782488e1b34ff489ba28d3c51a38f5fe6817238a59d2ed8ebda48b46441c","observation_id":"0f8d4ce9-1715-4f35-85a6-b5966dbb718c","resolution":{"observed_at":"2026-08-07T00:33:59.259043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:59.462375Z","title":"Semantic video CNNs through representation warping,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:59.462375Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:d0335da6e4aeb01c953b9569e5e7488d7ff10d67c3d49a72b6b359538336b6a9","observation_id":"e49f7b1c-d6e3-495a-95dd-92a34b3ba2b4","resolution":{"observed_at":"2026-08-07T00:33:59.462375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:59.614046Z","title":"Accel: A corrective fusion network for efficient semantic segmentation on video,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:59.614046Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:e6ac298ffb7c5ff63389be920457c10b116f5c1a2ae9a4a9627f4b0b806de0db","observation_id":"cc7701fb-96ec-424e-a689-ed74fec8b551","resolution":{"observed_at":"2026-08-07T00:33:59.614046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:59.743336Z","title":"Feature space optimization for semantic video segmentation,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:59.743336Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:fdad01590c47ed97dc734e9f08ae22ba69a82d8e7efa58ec4919e9f7a4065777","observation_id":"2b5fcb1e-3f4b-4062-8b16-712e434e6e1e","resolution":{"observed_at":"2026-08-07T00:33:59.743336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:59.924767Z","title":"GSVNet: Guided spatially- varying convolution for fast semantic segmentation on video,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:59.924767Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:63a58bf7eecc8d31687cf8be56c6b5636c5902bc7d4d14697257044a1ab0192d","observation_id":"dac8bbe6-599a-42b9-aac8-38ec1dd17ac0","resolution":{"observed_at":"2026-08-07T00:33:59.924767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:00.074750Z","title":"Faster R-CNN: Towards real-time object detection with region proposal networks,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:00.074750Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:a3862e9b1862e06b20ecb7aef4bea2cf3e80dd6cabbfd1ece95a454861bf9645","observation_id":"836ed6cd-b920-489c-bb5b-94b17f14f3ef","resolution":{"observed_at":"2026-08-07T00:34:00.074750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.00557","last_updated":"2018-03-27T10:02:26Z","snapshot_observed_at":"2026-07-06T06:26:10.399472Z","submitted_at":"2018-03-01T18:56:36Z","title":"The 2018 DAVIS Challenge on Video Object Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.00557","snapshot_observed_at":"2026-08-07T00:34:00.204825Z","title":"The 2018 DA VIS challenge on video object segmentation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:00.204825Z"},"links":{"cited_paper":"/paper/1803.00557","citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:109312c1cc1c7a11303220206b67818a14de7fb1c5e0d1e5f762033fdae00dd7","observation_id":"9fae1e36-1e5d-4815-936f-771abdc2910b","resolution":{"observed_at":"2026-08-07T00:34:00.204825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:00.315364Z","title":"Video segmentation using color difference histogram,","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:00.315364Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:fb1797f2b1bb3ccb15e1194475c5488c48787f94123ab62a06fcadfa401ae903","observation_id":"98dd2a0a-16e9-4355-ac21-c06e01bf2dce","resolution":{"observed_at":"2026-08-07T00:34:00.315364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:00.437943Z","title":"Dynamic texture detection based on motion analysis,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:00.437943Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:da46cb833d2b02b8cd9b6eb9e376712cc5ed6914922631f8991d2b8d6f19963b","observation_id":"2b755c7e-d26e-425e-9bf3-e1520ead7135","resolution":{"observed_at":"2026-08-07T00:34:00.437943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:00.540061Z","title":"Illumination robust optical flow model based on histogram of oriented gradients,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:00.540061Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:a9c2a7d993eac2e4c79cb507b7f7b6f28585c2974424a34b73f98baeb6083ad6","observation_id":"826bf546-1f70-411c-b6af-65ef57a52138","resolution":{"observed_at":"2026-08-07T00:34:00.540061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:00.657927Z","title":"Efficient video seg- mentation using parametric graph partitioning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:00.657927Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:c9833c5ed95ff364dc2bc2cbaf8857b4959d6107d6a5e20aa0300ff5b691a4be","observation_id":"fd39d94e-48ce-4edc-a2f4-d1ee7b9e2ee0","resolution":{"observed_at":"2026-08-07T00:34:00.657927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:00.772732Z","title":"Efficient hierarchical graph-based video segmentation,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:00.772732Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:9f238e21c25b6af19fea7257c559c1337ab6375789732635dbf0c4e02f6fe865","observation_id":"b9268be7-2f4f-40db-803f-b3f43a37ccac","resolution":{"observed_at":"2026-08-07T00:34:00.772732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:00.887346Z","title":"Fully connected object proposals for video segmentation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:00.887346Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:41851f4f0ef567640178f664711e8d6700aeb4f2e300b98c875a247dadeb3535","observation_id":"21bbe05e-6f2b-4aca-b0c9-2aeef630cd0c","resolution":{"observed_at":"2026-08-07T00:34:00.887346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:00.962544Z","title":"Semi-supervised video segmentation using tree structured graphical models,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:00.962544Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:2793ff0050465b148788bf0d2c86d786770d7b5e699ca14a291e7e0bfa41a22b","observation_id":"d874cbd4-6a11-4328-b040-f514b3e5cdac","resolution":{"observed_at":"2026-08-07T00:34:00.962544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:01.134824Z","title":"Streaming video segmentation via short- term hierarchical segmentation and frame-by-frame markov random field optimization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:01.134824Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:bc98894263820d8a10877ee6637cc7466b98b398341d0e1684bcad98f80b1a36","observation_id":"d45b4452-7eee-4ab3-8ee1-56f3c3fba46a","resolution":{"observed_at":"2026-08-07T00:34:01.134824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:01.254806Z","title":"Multiclass semantic video segmentation with object- level active inference,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:01.254806Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:7736b8c6ab909193d240680468f01913a43a2ec37f86c3ea22efa42430c938a8","observation_id":"5c3dc480-6114-46c8-b06a-781fd5cf5872","resolution":{"observed_at":"2026-08-07T00:34:01.254806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:01.358790Z","title":"DeepLab: Semantic image segmentation with deep convolutional nets, atrous convolution, and fully connected CRFs,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:01.358790Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:863540383504ec99f9f68f1427f561ddf07185d9f546728461e9209d74544ac8","observation_id":"7d3531d0-717a-4131-97df-7c23a7013199","resolution":{"observed_at":"2026-08-07T00:34:01.358790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:01.524806Z","title":"Pyramid scene parsing network,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:01.524806Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:823d1c3de74a8853db6ccadf63f84e0f26587473d1de61214a8712bd499b96cd","observation_id":"f0a5131e-b252-43cc-8358-6901bc0dc772","resolution":{"observed_at":"2026-08-07T00:34:01.524806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:01.663825Z","title":"Context contrasted feature and gated multi-scale aggregation for scene segmen- tation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:01.663825Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:a0f85e1da15019b4db3bd5bfdaf8af452ed4fb1c55e72704e0ec1a14e4908126","observation_id":"3b1c9897-241f-426a-ba6b-13b6fc353a6d","resolution":{"observed_at":"2026-08-07T00:34:01.663825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:01.780136Z","title":"Video segmentation via object flow,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:01.780136Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:9d5ed5754e379490e414ff3236c8f0f52ee79041630d5af4047bcc9d120bcf4f","observation_id":"fe71bb6f-a9cd-4137-9b49-4df2f3c6e06f","resolution":{"observed_at":"2026-08-07T00:34:01.780136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:01.905781Z","title":"Improving semantic segmentation via video propagation and label relaxation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:01.905781Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:2f7494c62cc924249873810b34450fdd585d02234ae86b6f79051cc70c16c899","observation_id":"4e4524fb-958f-4d3a-9103-d15e4a2433f7","resolution":{"observed_at":"2026-08-07T00:34:01.905781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:01.983027Z","title":"Efficient uncertainty estimation for semantic segmentation in videos,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:01.983027Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:3a6c91e5884858b4c173cef14c5b082ed62e5081335941372ceeec9cf12cca86","observation_id":"aa3ab57a-6a4d-4e52-ac8a-665b3263a62c","resolution":{"observed_at":"2026-08-07T00:34:01.983027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:02.118408Z","title":"Efficient video semantic segmentation with labels propagation and refinement,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:02.118408Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:3848af6cdba73e4e166253d10ef138ac885f4cb212b492a68d9ab5b0f4026eea","observation_id":"1a9566cb-4b55-4da2-9561-8f4d815920de","resolution":{"observed_at":"2026-08-07T00:34:02.118408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:02.274746Z","title":"ICNet for real-time semantic segmentation on high-resolution images,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:02.274746Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:8a342833475e7fcd33a031cf9404a0025748516325f49de94c8898e9895164e1","observation_id":"01e104bc-a325-4770-8b07-95ccbeea9590","resolution":{"observed_at":"2026-08-07T00:34:02.274746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:02.354824Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:02.354824Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:3ff756c5648e2568f4018991da762fae174af0cd645cf96e249373aa22742805","observation_id":"57ccfefb-d02b-40b1-bf46-c2bf6e3c7705","resolution":{"observed_at":"2026-08-07T00:34:02.354824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:02.491445Z","title":"Scaling vision transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:02.491445Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:db4651d9fd1454863913f85e290051b0bb2dc1d7cb1313e85b44eef60b6252a9","observation_id":"af50bf9e-9394-4bf8-ab46-878140ca936a","resolution":{"observed_at":"2026-08-07T00:34:02.491445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:02.598264Z","title":"AdaViT: Adaptive vision transformers for efficient image recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:02.598264Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:4bfea1305f6c55ef9a8084880bb9d3adf9efb0374e6ded578fc6e94411aa9d30","observation_id":"d38aac0a-979c-40d8-abfe-993545434070","resolution":{"observed_at":"2026-08-07T00:34:02.598264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:02.731986Z","title":"Vision transformers with hierarchical attention,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:02.731986Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:af35d42c78f9ebbfc04082a1cb8f07a3ce313a0586070a0ba082f21b85f74380","observation_id":"88718df6-0c68-44d3-add3-3df52ae403ad","resolution":{"observed_at":"2026-08-07T00:34:02.731986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:02.897966Z","title":"Swin transformer v2: Scaling up capacity and resolution,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:02.897966Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:920a7db108a7e09e265d6980582b36f032f8fef514f9164ccee1e65f8e2b609e","observation_id":"26f969ce-7a08-4fe7-9d0a-5aff96aecef5","resolution":{"observed_at":"2026-08-07T00:34:02.897966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:03.024457Z","title":"Scaling vision transformers to gigapixel images via hierarchical self-supervised learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:03.024457Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:d761ed2809c296fa305ed78e4ad820ac0bc363726e10b49e4de877a8acae4a2f","observation_id":"5ca3b003-6c26-46e3-bba3-498b4a2b587c","resolution":{"observed_at":"2026-08-07T00:34:03.024457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:03.157873Z","title":"Multiview transformers for video recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:03.157873Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:91c851e5284548292e686a813c263edc2c64fa3d965b437793a99cdd3f2688c7","observation_id":"1d63dca3-9cbd-43d0-a1a3-a326da4511d8","resolution":{"observed_at":"2026-08-07T00:34:03.157873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:03.300273Z","title":"Multi-scale high-resolution vision transformer for semantic segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:03.300273Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:0be8dfe916ad5dff45fd0a3b31851084f334549e6ca612e6ad6ec1b43dcbcab3","observation_id":"6253633b-6fb3-43a4-910f-74291bbea2fe","resolution":{"observed_at":"2026-08-07T00:34:03.300273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:03.430524Z","title":"UniRepLKNet: A universal perception large-kernel ConvNet for audio video point cloud time-series and image recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:03.430524Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:350211053037b7de896774544db7a3186697455dadb14046163f1fa5adf62d49","observation_id":"50c4e153-72fd-4b2b-9019-e562182067dc","resolution":{"observed_at":"2026-08-07T00:34:03.430524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:03.541148Z","title":"P2T: Pyramid pooling transformer for scene understanding,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:03.541148Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:9ef09b0b2361ad710f85d17f5767f7192dc7a4e093d36a79d6d3f319bfbb20ad","observation_id":"76cab0f6-13f2-4b7d-b2b9-2d4bac21c7f5","resolution":{"observed_at":"2026-08-07T00:34:03.541148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:03.699407Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:03.699407Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:fc27cf51fc279e32abaaf66638a7aedf369cf10d1d802220fe9c7bc5807be8e3","observation_id":"feff35e6-f6cb-40ee-9f4b-f1fe2c8d19d5","resolution":{"observed_at":"2026-08-07T00:34:03.699407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:03.814874Z","title":"End-to-end object detection with transformers,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:03.814874Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:336ec906d4a3c01e40ed369fc533500bab4178f6a7b53aff832366294437aefe","observation_id":"5b3c5e1c-89b7-4287-878f-60a471fc103f","resolution":{"observed_at":"2026-08-07T00:34:03.814874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:04.036666Z","title":"MOTS: Multi-object tracking and segmenta- tion,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:04.036666Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:b5b7569ca4a61eceff1ab47458a6f2b62fc7e1e8e26e8569cdfe2e6365cbac20","observation_id":"a63cacb4-4800-4ef4-ad94-4506df7464e3","resolution":{"observed_at":"2026-08-07T00:34:04.036666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:04.157555Z","title":"Tracking anything with decoupled video segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:04.157555Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:0b236f86784c03847b1b255faa4a221abae97dc8cd54b6b7b5a2f802cbefe2d9","observation_id":"85ac7ed9-7e3d-4026-bca3-83a18cdf4ef4","resolution":{"observed_at":"2026-08-07T00:34:04.157555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:04.334747Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:04.334747Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:2db553178ec50729da3c7ce64f9cba9e2036a26e26829e427fd80f1a5747fbf0","observation_id":"fca3ca01-358b-455f-94c6-29231202822d","resolution":{"observed_at":"2026-08-07T00:34:04.334747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:04.454404Z","title":"Global knowledge calibration for fast open- vocabulary segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:04.454404Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:07c8b78911a91e959748c84c557c7284494a9f2700bb57d6770a11ae83d93d08","observation_id":"6f77b031-5bf3-42fa-9f10-99e91fdbfec8","resolution":{"observed_at":"2026-08-07T00:34:04.454404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:04.549524Z","title":"A simple framework for open-vocabulary segmentation and detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:04.549524Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:a65fb70cfc616241dc4655731d7d11f163930827ec57cf071bbe02fb5f6826de","observation_id":"9f24150a-34a5-4612-ae49-d36174dcf1aa","resolution":{"observed_at":"2026-08-07T00:34:04.549524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:04.674352Z","title":"Learning open-vocabulary semantic segmentation models from natural language supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:04.674352Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:fdddbe8f0591409ebe8bf818e92ce56e060e9fe26c8dd7d396ab1c2f003bafaf","observation_id":"b99e28f0-256b-4aab-85d6-3e36d14fc9a8","resolution":{"observed_at":"2026-08-07T00:34:04.674352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:04.793483Z","title":"Open-vocabulary semantic segmentation with decoupled one-pass network,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:04.793483Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:d42b118f44999c5d6f7e9519dfaa78ee35bd18ef69fd74cfc21c77bc83cb3520","observation_id":"942f287c-b8d9-4e89-978c-d54af22f3ad3","resolution":{"observed_at":"2026-08-07T00:34:04.793483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:04.894745Z","title":"Open-vocabulary panoptic segmentation with embedding modulation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:04.894745Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:a60560a86e4d48e6e3c6a6df213bae85e0114b6551114916268d5cc8f6d2fef3","observation_id":"668d5ff7-4099-45d4-8035-6079a104b7d4","resolution":{"observed_at":"2026-08-07T00:34:04.894745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:05.004746Z","title":"A survey on deep learning technique for video segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:05.004746Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:2c26a63cb6b88cdbab3058ac04a3aba301c372f6af575268151f2d4fbdba822e","observation_id":"e5cc146d-af16-41e0-9343-732a6030d9df","resolution":{"observed_at":"2026-08-07T00:34:05.004746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:05.121390Z","title":"Transformer-based visual segmentation: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:05.121390Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:79d79c5f6bf6c64649eaa848a6d1c6e1e4d78357725b900a4f3d962a2c4f6847","observation_id":"e7600f4b-01f7-47e7-8905-16648de4911e","resolution":{"observed_at":"2026-08-07T00:34:05.121390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:05.316659Z","title":"Large- scale video panoptic segmentation in the wild: A benchmark,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:05.316659Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:5b0ca848255a549f011cd3a39f44a4610a9733c690e9832bc6d64bc51bc99383","observation_id":"4b72136b-d99f-4c28-a332-a0b9948b9484","resolution":{"observed_at":"2026-08-07T00:34:05.316659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:05.427453Z","title":"Machine perception of three-dimensional, so lids,","venue":null,"work_id":null,"year":1961},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:05.427453Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:40cf7b16640540a6581a6e8310667d2ddade8f0611e94003f9536a2b8f42d1ae","observation_id":"defb666c-a057-4e7e-b1ad-d5bbf7f1b19c","resolution":{"observed_at":"2026-08-07T00:34:05.427453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:05.517844Z","title":"Evaluation of super-voxel methods for early video processing,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:05.517844Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:745dae66648c73a2059ddabbfa29e0955c725b98e60def61aae1f6c4d26477a1","observation_id":"30af391d-a1aa-4387-a794-f94f1af6d060","resolution":{"observed_at":"2026-08-07T00:34:05.517844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:05.617779Z","title":"A video representation using temporal superpixels,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:05.617779Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:34c6b7a94e0b4165e965005a5056bcaf90ea961ab3c0ffd658cb8722722a9654","observation_id":"493adf38-e6db-4b65-9e85-d570c0614480","resolution":{"observed_at":"2026-08-07T00:34:05.617779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:05.734262Z","title":"Segmentation of moving objects by long term video analysis,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:05.734262Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:d21aee21ecde4f41c0d0918b72805857fdf14276c9591c5c9cdba3a466697d77","observation_id":"ec968894-d535-46d0-b04f-4733bb3f35ad","resolution":{"observed_at":"2026-08-07T00:34:05.734262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:05.864747Z","title":"Fast object segmentation in uncon- strained video,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:05.864747Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:5687c6acd681ae76eec9662390bbac4c08844a6c053aa7cf8d1afe2aab49035a","observation_id":"f23c7d2a-aa8a-4d8f-a121-66c6b81934a2","resolution":{"observed_at":"2026-08-07T00:34:05.864747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:05.990851Z","title":"Coherent motion segmentation in moving camera videos using optical flow orientations,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:05.990851Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:533d76a5190fcbce9fa78a964ff50f040f4647660ee4a2613aaf9acb79ee6b8e","observation_id":"f5978731-1006-4bfe-82e0-aab0ed50bfdc","resolution":{"observed_at":"2026-08-07T00:34:05.990851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:06.149809Z","title":"Layered segmentation and optical flow estimation over time,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:06.149809Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:3193941409c337c253935f5927cf00a07aad9e413d985658d8b378cf0b00392d","observation_id":"ec056af4-a82a-47e7-ba6e-a6f447a42423","resolution":{"observed_at":"2026-08-07T00:34:06.149809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:06.257921Z","title":"Dynamic color flow: A motion- adaptive color model for object segmentation in video,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:06.257921Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:f5a7e41c7f8f7cad4a678db6497e7b91bc6bf7770ea39d3a2d00b617bb0f442d","observation_id":"9e3e3670-ff4a-49a8-8747-5abf5f0596b5","resolution":{"observed_at":"2026-08-07T00:34:06.257921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:06.351798Z","title":"Steadyflow: Spatially smooth optical flow for video stabilization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:06.351798Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:09c0ac9992b08106225b0f7d972b64c74fc56e6b269a4e9a5589eb42b757b3c2","observation_id":"cb414276-5bfe-4268-a0f5-1bad1700f066","resolution":{"observed_at":"2026-08-07T00:34:06.351798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:06.517994Z","title":"Classifier based graph construction for video segmentation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:06.517994Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:8e422f495c0e65d9c86d842f220f67b77bf094c2ce70e6a121380fd28f5ec87b","observation_id":"d5e6821c-bf24-45e3-a1fa-2f12c398f375","resolution":{"observed_at":"2026-08-07T00:34:06.517994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:06.614912Z","title":"Jf-cut: A parallel graph cut approach for large-scale image and video,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:06.614912Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:d0b689dd632e46e71714aeb6dc8d0c536ef6d80f7e7e7f7c60d83e52ad058546","observation_id":"53f68458-7286-4678-8e6e-baa4f0d90d56","resolution":{"observed_at":"2026-08-07T00:34:06.614912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:06.689435Z","title":"Video scene parsing with predictive feature learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:06.689435Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:a248546836571d5d7c43e102b5ce5d460a965f239808b2009b76c9c07725810d","observation_id":"93b17d4e-2f43-4eb3-82ca-22fc80d5acb8","resolution":{"observed_at":"2026-08-07T00:34:06.689435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:06.768951Z","title":"Neural window fully- connected CRFs for monocular depth estimation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:06.768951Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:15a0e6294af7f39a6cc300962eeddb41ce0a3e9d258f0f84b2ef230b4561b507","observation_id":"aa74bac6-7cf4-4ba4-bbb3-79c28b33800b","resolution":{"observed_at":"2026-08-07T00:34:06.768951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:06.951794Z","title":"Video instance segmentation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:06.951794Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:155c7023a83c415a1ad3686735532bd5d57c0720c7357ee542d2bcc39cfe44da","observation_id":"1b581c6d-02b8-4d04-8385-c6c970a35697","resolution":{"observed_at":"2026-08-07T00:34:06.951794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:07.087147Z","title":"Naive-Student: Leveraging semi- supervised learning in video sequences for urban scene segmentation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:07.087147Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:24a532dcb8e592a401725920d43ed8bd276235b4b1f72b5c5c8b8088afd9198c","observation_id":"7eaa0722-be22-4a8d-807f-440f537397f5","resolution":{"observed_at":"2026-08-07T00:34:07.087147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:07.220205Z","title":"Three ways to improve semantic segmentation with self-supervised depth estimation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:07.220205Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:c82fd898520d06ee407c6e98c65d0503b7a07a97d601ff5504975508fb0a936c","observation_id":"91869e41-006a-462f-894b-7b9ebbd31af7","resolution":{"observed_at":"2026-08-07T00:34:07.220205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:07.322429Z","title":"Simultaneously short- and long-term temporal modeling for semi- supervised video semantic segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:07.322429Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:778ab247baf9649022e83bdd06669379614f786f1439433dfb8e92a4924bf78c","observation_id":"26f49e3a-54d1-4499-83fa-05895d62826d","resolution":{"observed_at":"2026-08-07T00:34:07.322429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:07.410551Z","title":"Clockwork convnets for video semantic segmentation,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:07.410551Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:a692b2301e71200ba22f896aace3cedd1c087d4956bf9f5a4e4ce4a25bcf91ca","observation_id":"76ea655f-c773-482c-acf5-58631723679f","resolution":{"observed_at":"2026-08-07T00:34:07.410551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:07.538732Z","title":"Real-time, accurate, and consistent video semantic segmentation via unsupervised adaptation and cross-unit deployment on mobile device,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:07.538732Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:036acbb3fd9103f3e743754ff706a480c3fe2c07cae8ec3944a1ce00f33fd566","observation_id":"7e14442a-e063-4f20-a6f1-02d23b1a5754","resolution":{"observed_at":"2026-08-07T00:34:07.538732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:07.637631Z","title":"Dynamic video segmen- tation network,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:07.637631Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:3b44607e5ac40e7dacd9120fe08f126895741c9ccb3efbe269c06024c9cda274","observation_id":"b0aa6c78-40e9-493b-a535-526753f4d148","resolution":{"observed_at":"2026-08-07T00:34:07.637631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:07.702695Z","title":"Low-latency video semantic segmentation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:07.702695Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:af267d0f219d9f879431f2a974f0a6c766b459b5f71ff819af2b2ceff098abfb","observation_id":"1df01040-2989-4ef0-a59e-b1b810e1a92f","resolution":{"observed_at":"2026-08-07T00:34:07.702695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:07.882630Z","title":"Coarse-to- fine feature mining for video semantic segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:07.882630Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:18841a39d3b51dfb819389ed3216e9129693635e0e71c3a0b55f594c5e8448c9","observation_id":"a8015a52-48ec-4f38-90cc-62edddd31683","resolution":{"observed_at":"2026-08-07T00:34:07.882630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:08.053230Z","title":"Mining relations among cross-frame affinities for video semantic segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:08.053230Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:3af685e40463e90b2b9a7dfbeda009f308a74d82ae87d89e691f089a5f6c0947","observation_id":"b1a395de-f098-46d8-a78c-0a84c115415f","resolution":{"observed_at":"2026-08-07T00:34:08.053230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:08.179151Z","title":"Deep dual learning for semantic image segmentation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:08.179151Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:0c34e820f2878e133c29b82f5f6bca3062cd5ddbf4bce7e59e3cd5dd481e5f18","observation_id":"8cf99ca0-11e9-447e-9e5d-9fc38d6b35cc","resolution":{"observed_at":"2026-08-07T00:34:08.179151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:08.316560Z","title":"Learning pixel-level semantic affinity with image- level supervision for weakly supervised semantic segmentation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:08.316560Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:c5292e614df7e00b4e242c134e4828ca37c42b886b9c509395d0543112fee6d0","observation_id":"bab2890b-ed1d-4cf4-9dfb-caa986604e39","resolution":{"observed_at":"2026-08-07T00:34:08.316560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:08.433953Z","title":"PANet: Few-shot image semantic segmentation with prototype alignment,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:08.433953Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:f106b86e8518d70b0b88fe01ffd4e710be9fe3e8490b14cf02cf2864dcd8a3eb","observation_id":"6bffa7a0-cab6-44ae-b0a1-d81b6d93186e","resolution":{"observed_at":"2026-08-07T00:34:08.433953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:08.552660Z","title":"Single-stage semantic segmentation from image labels,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:08.552660Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:5e0688922d2dace81abbd5ce45591cdf12f22f68e7bb60a7a6646722827df458","observation_id":"03fe4280-f756-4b20-9fa7-161eb89560ad","resolution":{"observed_at":"2026-08-07T00:34:08.552660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:08.807396Z","title":"CIAN: Cross-image affinity net for weakly supervised semantic segmentation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:08.807396Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:460342fdfff3a7299f8d9452a0b9fee7ba13535d3be18bf4f75d7b5e3a0aceae","observation_id":"d784f311-dcf0-4374-a0e7-4193f9bb52c7","resolution":{"observed_at":"2026-08-07T00:34:08.807396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:08.967364Z","title":"Budget-aware deep semantic video segmentation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:08.967364Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:c63ff24b51c34a1ff80fe7afcd925ee2272c9130ab0b219ffc432b15b6a2a5a0","observation_id":"66173f4d-b1f1-429c-a8b9-e37e835146a2","resolution":{"observed_at":"2026-08-07T00:34:08.967364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:09.050085Z","title":"Convolutional gated recurrent networks for video segmentation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:09.050085Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:66403ce39a0bfcca365a805109ea609b80daa998033cea6346ec9972674d56cd","observation_id":"3de167c1-b845-4f9d-a313-3ac30b176ec5","resolution":{"observed_at":"2026-08-07T00:34:09.050085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:09.221211Z","title":"One-shot video object segmentation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:09.221211Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:e67dae9bde4ea8d4830f38cc89bb99d62a5cb5441136b161ffb86539235cc9d4","observation_id":"48ec189a-952b-4e61-978b-975baeb2c2f8","resolution":{"observed_at":"2026-08-07T00:34:09.221211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:09.410907Z","title":"Space-time memory networks for video object segmentation with user guidance,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:09.410907Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:385ed0338e431e1d0dba4180e1cf02be009ab9711c850c3edf76f92484367769","observation_id":"ab45e62e-9047-4cd8-b022-282682be1c71","resolution":{"observed_at":"2026-08-07T00:34:09.410907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:09.538200Z","title":"Learning video object segmentation from static images,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:09.538200Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:aba9d298d4d7103438b81ad6bd1c8115f95e1391c35827cdbf0ad5aeb91b121d","observation_id":"e72f6cd8-f6d1-4f7c-8daa-fc52f9512106","resolution":{"observed_at":"2026-08-07T00:34:09.538200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:09.674391Z","title":"RVOS: End-to-end recurrent network for video object segmentation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:09.674391Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:488f977251c26a224bf47ebbbe3d9391e7e60333a1011c2ebe110719a0a54436","observation_id":"4108a4f6-2476-4791-900f-a4dc2907b98b","resolution":{"observed_at":"2026-08-07T00:34:09.674391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:09.768766Z","title":"Putting the object back into video object segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:09.768766Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:35941a051b2a42b68f7bbba530afbbfd83528e484a832e4bcf34402caff4b0f6","observation_id":"0cdc3b50-8389-44b3-9cc3-5944b550aeb6","resolution":{"observed_at":"2026-08-07T00:34:09.768766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:09.984899Z","title":"Towards high performance video object detection,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:09.984899Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:9f2cd655449c45efd586905edc857ecdc48586a2355494c1f767b00786f5fb5f","observation_id":"2877c12f-52df-4d30-b9ce-8ac9d90f0a77","resolution":{"observed_at":"2026-08-07T00:34:09.984899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:10.089214Z","title":"Flow-guided feature aggregation for video object detection,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:10.089214Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:b6a2528a0884f8e7d9ee9999d0d4cc9f444cf9704f9e5de6d058f0aea29319eb","observation_id":"3a5ff8af-2fd4-4ba8-8b0b-1155b71644ee","resolution":{"observed_at":"2026-08-07T00:34:10.089214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:10.206279Z","title":"Fully motion-aware network for video object detection,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:10.206279Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:3795da0ac11c78210b70c8ed23de933340f219b5ccfe67e88ebce772364664d0","observation_id":"401d48b9-333b-4553-b120-d1558fe53cd2","resolution":{"observed_at":"2026-08-07T00:34:10.206279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:10.408814Z","title":"Mamba: Multi-level aggregation via memory bank for video object detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:10.408814Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:2aec4a0d3a280453d0efd5c3bf24c26ec9f19e63c606322ee49c512ac5a4e7ac","observation_id":"18847c93-7024-4125-a2d3-2d97984c1b9d","resolution":{"observed_at":"2026-08-07T00:34:10.408814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:10.516369Z","title":"Dynamic context-sensitive filtering network for video salient object detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:10.516369Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:340eedcfc6df6f3bf425a5a2cc23b5082866c4055fce415b4647d669ec6b2c28","observation_id":"14212d00-720d-41b0-91a6-6e47b9900d0c","resolution":{"observed_at":"2026-08-07T00:34:10.516369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:10.608917Z","title":"SAM-PM: Enhancing video camouflaged object detection using spatio-temporal attention,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:10.608917Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:1b265a9abbe42fc23289f647633d95f5b700d1fa64ab59050a6d7d974d039e49","observation_id":"b03afc6c-1d24-4121-9e18-cb9336d54482","resolution":{"observed_at":"2026-08-07T00:34:10.608917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:10.723158Z","title":"Deep spatio-temporal random fields for efficient video segmentation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:10.723158Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:cf6520f7ce7a99e842d417325b52b90ffef1852df89ed761111095e71f2c906c","observation_id":"f10ddbd0-4931-4b52-ba39-660b6f4d8fbc","resolution":{"observed_at":"2026-08-07T00:34:10.723158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:10.807229Z","title":"A benchmark dataset and evaluation methodol- ogy for video object segmentation,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:10.807229Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:87d3f6ab4bacb484cfaf499936ff0e0aa046a8b68769e2445af81f8d954c53d6","observation_id":"640e3704-d736-41c0-9d73-0903ad916b86","resolution":{"observed_at":"2026-08-07T00:34:10.807229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00675","last_updated":"2018-03-01T17:50:08Z","snapshot_observed_at":"2026-08-02T10:51:13.194643Z","submitted_at":"2017-04-03T16:44:46Z","title":"The 2017 DAVIS Challenge on Video Object Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00675","snapshot_observed_at":"2026-08-07T00:34:10.897294Z","title":"The 2017 DA VIS challenge on video object segmen- tation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:10.897294Z"},"links":{"cited_paper":"/paper/1704.00675","citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:d739be0f9d6789006c35f4b960fecaeb29fcb8355723ecc15d137cdb879e8919","observation_id":"920a33d2-f88a-4861-8327-2946fec61488","resolution":{"observed_at":"2026-08-07T00:34:10.897294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:11.079998Z","title":"Segmentation and recognition using structure from motion point clouds,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:11.079998Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:3b36b2f8f2a32e58fe99e521df7a052b6252ecb86ca42c3e17f0ad0c5fb4d477","observation_id":"518bf01a-d599-4974-8350-37fc7e1d69a6","resolution":{"observed_at":"2026-08-07T00:34:11.079998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:11.213688Z","title":"The Cityscapes dataset for semantic urban scene understanding,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:11.213688Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:ba4ae6f660cba5555032d8f15fdc7fe9e129cb153e4c5ce5231c60c221993a4f","observation_id":"7e3ca2fa-f333-4886-8dcc-aa20811fbf36","resolution":{"observed_at":"2026-08-07T00:34:11.213688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:11.333781Z","title":"Semantic video segmentation by gated recurrent flow propagation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:11.333781Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:ff7f235cc2555dd0e815368e307df5d1066d950f2c5db1a49551c2bee4979fe5","observation_id":"2a09aeff-32dd-4884-a9c5-b1bc2c4c6632","resolution":{"observed_at":"2026-08-07T00:34:11.333781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:11.453873Z","title":"Are we ready for autonomous driving? the KITTI vision benchmark suite,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:11.453873Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:e55375f2c8393e9bdfc5818d4fa505195530c890a9cb682b8b2ec085f93b7aa1","observation_id":"fb05ac8b-dcd3-413c-a5c8-dd75aa83b326","resolution":{"observed_at":"2026-08-07T00:34:11.453873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:11.554961Z","title":"Every frame counts: Joint learning of video segmentation and optical flow,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:11.554961Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:6f16531b55953509863ccb8e344435fb86aa827bdb2c4ba11b13e4ac73cb42b6","observation_id":"865a67a5-87a4-439c-974b-b74799cae546","resolution":{"observed_at":"2026-08-07T00:34:11.554961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:11.696336Z","title":"Temporally distributed networks for fast video semantic segmenta- tion,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:11.696336Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:1adf755ff262ef9b4bb1b84c27df4f90921a1f9c201a696a7ace88d7437f5fdc","observation_id":"5b761abc-a22e-403b-bb5b-ab8fd61c20d7","resolution":{"observed_at":"2026-08-07T00:34:11.696336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:11.807488Z","title":"Indoor segmentation and support inference from RGBD images,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:11.807488Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:3f30e8bc3c995bd085fc91f7325a982e26932996e0e3ee387c286829aa151cbb","observation_id":"5bfd9120-3240-416f-a22e-bb7f82605c33","resolution":{"observed_at":"2026-08-07T00:34:11.807488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:12.008044Z","title":"Efficient semantic video segmentation with per-frame inference,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:12.008044Z"},"links":{"citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:a5dc6565750b0d80c8eca3960f962bb9704faad9188bd96310085003a3daa3e0","observation_id":"fe08dc35-0ba6-4ec5-b895-6e3ad8c1f9b9","resolution":{"observed_at":"2026-08-07T00:34:12.008044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":221},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 221 outbound references and 0 inbound Pith citation observations for arXiv:2506.13552."}