{"as_of":"2026-08-16T03:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d0450629f7dfdad453dfeb0c0975e8f464d420150f95f81f990b3c4e0a58750c","coverage":[{"denominator":93,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":93,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T07:03:37.371525Z","state":"measured"},{"denominator":93,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":93,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.21592/citation-record","integrity":"/paper/2607.21592/integrity","json":"/paper/2607.21592/citation-record.json","paper":"/paper/2607.21592"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:26.931081Z","title":"Advances in Neural Information Processing Systems37, 61872–61911 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:26.931081Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:174a935701057817f93898608564edb8a21555a82027515438340e09ef71e403","observation_id":"2ffdb801-3428-4975-8073-9489abd74df6","resolution":{"observed_at":"2026-08-01T07:03:26.931081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:27.031259Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:27.031259Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:d62235685e2e8546b9c0152a60004b54e161302565826aa3b8d3937e9d8e9e9b","observation_id":"c9878eb7-c84a-41f6-aa87-83934212f65e","resolution":{"observed_at":"2026-08-01T07:03:27.031259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:27.185236Z","title":"arXiv preprint arXiv:2502.13078 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:27.185236Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:5db9186a04d0397dc89f8446047f3638d253ae6e497f5597ab8c0d8acc46b86c","observation_id":"a64f342a-773e-4bc8-9964-22916a634c93","resolution":{"observed_at":"2026-08-01T07:03:27.185236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:27.285290Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:27.285290Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:64f4f7961578dd45c89fff70d89ed4cd39a2d56a1a0103d63bcde57f89f39436","observation_id":"f8ba63e2-649d-44e1-923b-8cd71dc72981","resolution":{"observed_at":"2026-08-01T07:03:27.285290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:27.381867Z","title":"IEEE transactions on pattern analysis and machine intelligence37(8), 1670–1687 (2014)","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:27.381867Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:af76f8d9300eb861848918c9ced4fb9e44f07867ef8bfc7e1ccc745aa992be3c","observation_id":"49c79f47-6c62-4cb2-8c06-9c4bac195ade","resolution":{"observed_at":"2026-08-01T07:03:27.381867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:27.420945Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:27.420945Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:2559b9deb58d7f1010283ca832d9041becc18a951a26184099e6c3582d4b91d4","observation_id":"6a58ba19-b886-46c6-9fbc-4e29237101e3","resolution":{"observed_at":"2026-08-01T07:03:27.420945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:27.476233Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:27.476233Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:28495dfe36ed8774bc9ebe90da9df971e04da20a0ff02f59cfbf6069cd3e1330","observation_id":"e951d9f6-56a7-4dcf-afed-8493bd29b999","resolution":{"observed_at":"2026-08-01T07:03:27.476233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-01T07:03:27.514777Z","title":"arXiv preprint arXiv:2311.15127 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:27.514777Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:cf9a63350da26595abf684d092dc7d504bbbdf57f1971914ba23090f26906090","observation_id":"423e39dd-33cf-488f-aa33-208c25aa5ec8","resolution":{"observed_at":"2026-08-01T07:03:27.514777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02073","last_updated":"2025-04-21T12:09:08Z","snapshot_observed_at":"2026-08-02T06:32:26.688405Z","submitted_at":"2024-10-02T22:42:20Z","title":"Depth Pro: Sharp Monocular Metric Depth in Less Than a Second","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02073","snapshot_observed_at":"2026-08-01T07:03:27.580913Z","title":"arXiv preprint arXiv:2410.02073 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:27.580913Z"},"links":{"cited_paper":"/paper/2410.02073","citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:d36027fc16dbb1d11e887241e93656cccaa11261b91fa13071426c46f189b260","observation_id":"d6e007bb-4eb4-4147-a45e-08189d139b25","resolution":{"observed_at":"2026-08-01T07:03:27.580913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:27.686593Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:27.686593Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:66f00fdb72815133c411a631cd7e694f074b040e23d98a349d9442f695e12c5e","observation_id":"9c4e54a4-67f3-432b-bbe0-7079aa1ffa92","resolution":{"observed_at":"2026-08-01T07:03:27.686593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:27.782999Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:27.782999Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:71dd92180c4a2b5e6ae906fbd0204b4b98667d4dede3996815f03d623f659770","observation_id":"24943473-9ce7-4291-b82b-b7fe158bd0a5","resolution":{"observed_at":"2026-08-01T07:03:27.782999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.10773","last_updated":"2020-01-29T12:13:20Z","snapshot_observed_at":"2026-07-06T08:53:28.193420Z","submitted_at":"2020-01-29T12:13:20Z","title":"Virtual KITTI 2","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.10773","snapshot_observed_at":"2026-08-01T07:03:27.868018Z","title":"arXiv preprint arXiv:2001.10773 (2020)","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:27.868018Z"},"links":{"cited_paper":"/paper/2001.10773","citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:ef5e5bc7e6ed223fbccf6f7ad281f5b14c71ff3297ebd9fe20fb6cf9dd8eea4d","observation_id":"1e629274-6ae1-4ea6-a5d1-11773e32c778","resolution":{"observed_at":"2026-08-01T07:03:27.868018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:27.934420Z","title":"In: Proceed- ings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:27.934420Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:096a295529bbd2ae405516e9142bce7967386953c409ba676790da675816a97f","observation_id":"fd0e7a3f-c000-41d5-9f1a-11aded3e3895","resolution":{"observed_at":"2026-08-01T07:03:27.934420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:27.998355Z","title":"ACM Transactions on Graphics (TOG)43(6), 1–12 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:27.998355Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:f0aa30bd9e155d21cbdafd807a3affb4ed89d9ae872bd5734785d49c36a2e872","observation_id":"7286e6fe-cb65-482d-880c-ec4ab8ce15f2","resolution":{"observed_at":"2026-08-01T07:03:27.998355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:28.206829Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:28.206829Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:51bbe4104e9d0ed3a4198420bbe90e2e2bf0817decce9726790b3bd56c75070a","observation_id":"2e8d71e3-f39e-4c4c-98ab-b2d197ffbcb7","resolution":{"observed_at":"2026-08-01T07:03:28.206829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:28.397757Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:28.397757Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:53d38c81acd3d0a63999b8ca576326700fc8321fcd39e7c513d0ae6d73091080","observation_id":"9a3c9874-d613-4fdc-a98f-2d9caffadc12","resolution":{"observed_at":"2026-08-01T07:03:28.397757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:28.482032Z","title":"In: Unified Video Dense Prediction from Disjoint Data 17 Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":1971},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:28.482032Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:93e08b339888d82945d79f5a88d604cea112208b0014aa87c5d438fb9429b3d3","observation_id":"c51bc542-019a-4ab3-b9d9-5ed3b10309ba","resolution":{"observed_at":"2026-08-01T07:03:28.482032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:28.657135Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:28.657135Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:dc4aaa350cd6a4b1175e1e2a8317842691363e564ea0db8f89aecc46c49d1ac8","observation_id":"85e33207-b16a-46fd-b855-a34b05be86a4","resolution":{"observed_at":"2026-08-01T07:03:28.657135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:28.802512Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:28.802512Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:966ca7cd55a74071f18819e9c2ea4d624c8e0ca397a9778f160ca5b10279330b","observation_id":"8f768fc0-7257-47dd-b682-44809ce80a41","resolution":{"observed_at":"2026-08-01T07:03:28.802512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:28.937113Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:28.937113Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:d6af774d3d84f07b943284af45f02430caddc93013586b9dbcc70a7d98018e41","observation_id":"889fcac0-799d-45ee-954f-9d42eae28efc","resolution":{"observed_at":"2026-08-01T07:03:28.937113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:29.069782Z","title":"In: Forty-first international conference on machine learning (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:29.069782Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:389c9ff61d2eb4604ee1b672a396ea6db38807fcfa3650bd247cebc8006d6839","observation_id":"a02f15a4-da1e-4e57-a19e-be07167f0642","resolution":{"observed_at":"2026-08-01T07:03:29.069782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:29.196445Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:29.196445Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:9bf2b36645d93b80184bf37ca92b3459ba4cc86d0fb3ed5a4a77ac876241a03d","observation_id":"8c8ecf86-9cf3-4eb6-b2ee-1062013d4340","resolution":{"observed_at":"2026-08-01T07:03:29.196445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:29.337179Z","title":"In: 2012 IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:29.337179Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:a580a6d4354eb2edc47c1c566a277a6e138744f7fbefbdb83ca1bbcb84e07a03","observation_id":"13d84290-a8d4-4171-99fa-4735032b1558","resolution":{"observed_at":"2026-08-01T07:03:29.337179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:29.473055Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:29.473055Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:194db4f7e8922f777251547115207fbc7e9e480323425d4d4746bf06fc0dbd9a","observation_id":"f9aef3b3-ad4d-46c6-8faa-cfda2637ccab","resolution":{"observed_at":"2026-08-01T07:03:29.473055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18124","last_updated":"2025-01-18T20:14:54Z","snapshot_observed_at":"2026-08-15T14:15:09.968049Z","submitted_at":"2024-09-26T17:58:55Z","title":"Lotus: Diffusion-based Visual Foundation Model for High-quality Dense Prediction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18124","snapshot_observed_at":"2026-08-01T07:03:29.592808Z","title":"arXiv preprint arXiv:2409.18124 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:29.592808Z"},"links":{"cited_paper":"/paper/2409.18124","citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:a88a399717e53f6a1a1d453c9e3f1bab8dccf2daa4179bd588ecc9c60ccc6ee8","observation_id":"7240dba7-4645-4e9e-b0f1-3261910edd03","resolution":{"observed_at":"2026-08-01T07:03:29.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-01T07:03:29.719378Z","title":"arXiv preprint arXiv:2210.02303 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:29.719378Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:e61d5ef36e7941109b71730f702c1d14afeae7004f62045bfdddc49da39e4b18","observation_id":"71cf89a8-c080-4240-8dc0-0da794ed7ad2","resolution":{"observed_at":"2026-08-01T07:03:29.719378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:29.906827Z","title":"Advances in neural information processing systems33, 6840–6851 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:29.906827Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:b74ebac055fd0c2c2f24bcf445e3c29ed0c91334df933e52fd82b70d4fb616ef","observation_id":"ae687d66-a0e0-4697-8402-237d1eac7f01","resolution":{"observed_at":"2026-08-01T07:03:29.906827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-01T07:03:30.066508Z","title":"arXiv preprint arXiv:2207.12598 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:30.066508Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:cc17eabd45d8207a2485816c47f289fe786144fcfa1e4211c7633aaaf8f573bd","observation_id":"a032f54d-5d91-4c43-b785-a1dcf80336fc","resolution":{"observed_at":"2026-08-01T07:03:30.066508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:30.218649Z","title":"Advances in neural information processing systems35, 8633– 8646 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:30.218649Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:fac73e247166c84ff715998a5166f74de458a0c119397ef5839796236e21080e","observation_id":"d13c34c4-be1a-44cf-be8e-504f26c51d27","resolution":{"observed_at":"2026-08-01T07:03:30.218649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:30.364608Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:30.364608Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:45e1418059b35c4967c2a10af8ac5c90b69a67028c0c5326d860f632ec94af34","observation_id":"746bf5b8-9065-4eca-8dd7-055a4b49911e","resolution":{"observed_at":"2026-08-01T07:03:30.364608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:30.501554Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:30.501554Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:d83be124370b7f2539739b093c3bedfaef1af816bcc0d6bed011c139eda14640","observation_id":"5f3b5d23-3c31-444b-afc3-b45f14cd8381","resolution":{"observed_at":"2026-08-01T07:03:30.501554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:30.679058Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:30.679058Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:d1f6cfd4e319737f0fca07006d27670af3f8860470eff57dd284569f1dcfafe3","observation_id":"0db3ffd2-9bb3-49a5-8b4b-c32a819bb74e","resolution":{"observed_at":"2026-08-01T07:03:30.679058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:30.815182Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:30.815182Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:9122c713e4cd110a08159343a663d5b4f3a164011ff5e018b95a8c3c8fa1d135","observation_id":"ab06bb3b-98af-4220-96f6-855bf39ca7d7","resolution":{"observed_at":"2026-08-01T07:03:30.815182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:30.977279Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recog- nition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:30.977279Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:f7e51f78056f97c38ff6f20512343d406a665cc6959e00da3eb796b59f4aaaea","observation_id":"8c03f095-15ed-468a-90e3-ef2e071924de","resolution":{"observed_at":"2026-08-01T07:03:30.977279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:31.158675Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:31.158675Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:c2338588b728f89a0000fe22ddef5aede2c34f55ca71fde9fab40dcab615881b","observation_id":"5ab4486f-432f-44d9-8597-cad47f109504","resolution":{"observed_at":"2026-08-01T07:03:31.158675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.14969","last_updated":"2023-03-27T07:58:42Z","snapshot_observed_at":"2026-08-14T02:35:55.747458Z","submitted_at":"2023-03-27T07:58:42Z","title":"Universal Few-shot Learning of Dense Prediction Tasks with Visual Token Matching","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.14969","snapshot_observed_at":"2026-08-01T07:03:31.293333Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:31.293333Z"},"links":{"cited_paper":"/paper/2303.14969","citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:de89c7b64bd1e9c26cd874284c6a0593f31d160d8cdd2434d26ec09e0448f473","observation_id":"ca132c7c-b1d9-4e4e-807d-8a65f4476174","resolution":{"observed_at":"2026-08-01T07:03:31.293333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:31.389360Z","title":"In: Proceedings of the European Conference on Computer Vision (ECCV) Workshops","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:31.389360Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:bef45708976b626784c74e6651b16d64d6b54813111d50200ba737035a2e9a80","observation_id":"14449dd3-5c5a-410e-96aa-0479a7eb705c","resolution":{"observed_at":"2026-08-01T07:03:31.389360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-08-14T12:12:01.418974Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-01T07:03:31.467431Z","title":"arXiv preprint arXiv:2312.14125 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:31.467431Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:53cc62c4cd09425022046b0b39faadfd14ef7cf309c45ab7d7d52ae50aa0909b","observation_id":"0b9a291d-83b3-4bcd-ad54-24f687eab5db","resolution":{"observed_at":"2026-08-01T07:03:31.467431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:31.551431Z","title":"Com- puter Vision and Pattern Recognition (CVPR) (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:31.551431Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:b933e9d02d57a003706c9712622d7c2e7e0f7a2a1d1fad0f7a719c4bf2906fc5","observation_id":"24f0b5d6-879e-4fbb-909a-ac27c3b4e779","resolution":{"observed_at":"2026-08-01T07:03:31.551431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:31.620793Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:31.620793Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:13926253163d8eb22adf283fac2b8125f9c9f701882539cd66702ba711882dc9","observation_id":"8fe69a94-a6b0-401f-92b3-de29923be3c6","resolution":{"observed_at":"2026-08-01T07:03:31.620793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:31.708230Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:31.708230Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:c4fa15acf57fed38d78d341471c39da17cdfa1c9593c73d6413e2e81e01e7429","observation_id":"ab0c4881-6400-481d-8a69-1705f32aa246","resolution":{"observed_at":"2026-08-01T07:03:31.708230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.00716","last_updated":"2018-09-03T20:42:27Z","snapshot_observed_at":"2026-08-14T18:33:35.369478Z","submitted_at":"2018-09-03T20:42:27Z","title":"InteriorNet: Mega-scale Multi-sensor Photo-realistic Indoor Scenes Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.00716","snapshot_observed_at":"2026-08-01T07:03:31.810833Z","title":"arXiv preprint arXiv:1809.00716 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:31.810833Z"},"links":{"cited_paper":"/paper/1809.00716","citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:acbfca5cdf71c3d91cc03637d0f78efe8077e1191cfdaf967acd945063d8b2ca","observation_id":"26848e70-dc59-4351-ae5c-3a87664c703e","resolution":{"observed_at":"2026-08-01T07:03:31.810833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15757","last_updated":"2025-02-16T03:01:55Z","snapshot_observed_at":"2026-08-12T23:58:33.570726Z","submitted_at":"2024-05-24T17:53:06Z","title":"Looking Backward: Streaming Video-to-Video Translation with Feature Banks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15757","snapshot_observed_at":"2026-08-01T07:03:31.971556Z","title":"arXiv preprint arXiv:2405.15757 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:31.971556Z"},"links":{"cited_paper":"/paper/2405.15757","citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:153de16fff97d6e0a54c4e6423f324b443d690aff584af96f59b7c8a5fbd56f7","observation_id":"48f3bd81-6775-491f-ab08-0d303a3092fd","resolution":{"observed_at":"2026-08-01T07:03:31.971556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:32.090684Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:32.090684Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:f0dd636dbc7f442e8f4e83716967459e3531195c99698e4657abebfc0bd31d70","observation_id":"8b2066c0-f1ec-4daf-8c1a-3bf3ab2541e4","resolution":{"observed_at":"2026-08-01T07:03:32.090684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:32.221083Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:32.221083Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:febb2f1cdd187697db4ea742351cd86a44be8649ff6bb1d5d05504a591fca981","observation_id":"1fca7b36-a841-4603-8c8c-6fa2bf79fcdc","resolution":{"observed_at":"2026-08-01T07:03:32.221083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:32.303716Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:32.303716Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:8ae1185783e889835317743bb420568451f7035f11c6aea53145de15aa0332c8","observation_id":"97e9d57c-244b-4e45-987e-79bf079e7c5c","resolution":{"observed_at":"2026-08-01T07:03:32.303716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-01T07:03:32.393156Z","title":"arXiv preprint arXiv:1711.05101 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:32.393156Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:2fb8dc9a499bb8b8805bf9f332b575fddb0bac1388992288e9237308f29520a7","observation_id":"80c6f351-5693-4d3a-b4b7-a2af790fed2c","resolution":{"observed_at":"2026-08-01T07:03:32.393156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:32.472468Z","title":"IEEE Transactions on Multimedia26, 6375–6385 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:32.472468Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:ed4359027b0a77f88432025fae981f1d423094ac75b2c54168f13cb1e6ccf788","observation_id":"ef357597-ed2b-4f3b-9d8b-1edc20918d26","resolution":{"observed_at":"2026-08-01T07:03:32.472468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:32.551967Z","title":"Unified Video Dense Prediction from Disjoint Data 19 In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:32.551967Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:5d32617ba5fcc8984708331083e9993cc4d0e3aae355572d2562215ce2b5fe2e","observation_id":"6f5eb33f-5e0d-4dbd-a6ec-2f50ec579692","resolution":{"observed_at":"2026-08-01T07:03:32.551967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:32.615359Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:32.615359Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:6b63dc9a0b86ef53cc705cd5235976422170387aca8becee97a5460c7908e724","observation_id":"11d019ea-8cb7-460a-a143-d6fbfa1ec97b","resolution":{"observed_at":"2026-08-01T07:03:32.615359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:32.790985Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:32.790985Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:d1130ef747dfe217b0598d7d63371b630a625920afc22e6ab39737a0a4149abc","observation_id":"c571e206-c8da-4b5b-a01d-0adf7aa920df","resolution":{"observed_at":"2026-08-01T07:03:32.790985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:32.890370Z","title":"In: Proceedings of the AAAI conference on artificial intelligence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:32.890370Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:22048fff6588ac6b9c02c9f91ac0a284f56f05404b04171b2fb80dd3f8404612","observation_id":"dac07321-af14-4b6a-b84c-3c9d9ffb460e","resolution":{"observed_at":"2026-08-01T07:03:32.890370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:32.940390Z","title":"In: Proceedings of the IEEE international conference on computer vision (2015)","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:32.940390Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:f004d3eb19ee06b1788f9999f2cfc6af04559f4593e96fd7c33d042498e71df1","observation_id":"4cc73501-36ad-4213-a05a-332d3f739709","resolution":{"observed_at":"2026-08-01T07:03:32.940390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:33.091328Z","title":"In: Proceedings of the IEEE international conference on computer vision","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:33.091328Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:c45ba70f0a6c96e45dde6fdc79c3b03fc5097d8417cf96a828f1e4131d610900","observation_id":"a4f897ff-25a8-4373-a1f3-51bab58ffabd","resolution":{"observed_at":"2026-08-01T07:03:33.091328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-01T07:03:33.171802Z","title":"arXiv preprint arXiv:2112.10741 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:33.171802Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:25f51619bc7e8b56dde09b6dd054912f21642177bb665b87a6415babc1186722","observation_id":"7d028934-facb-47af-a7f8-9319eceae383","resolution":{"observed_at":"2026-08-01T07:03:33.171802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:33.279655Z","title":"https://www.pexels.com/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:33.279655Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:858de290aa01b70dca23eece9233b295c9d821d10f1f09ddd9020d308d66a8cc","observation_id":"6f08675f-749d-4ee9-955c-f0c86863df87","resolution":{"observed_at":"2026-08-01T07:03:33.279655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:33.402888Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:33.402888Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:d372903e6302d1e6801040b47d36c6eea6f7423b9dbdf72277f6b5a71ebd51eb","observation_id":"af1a8c08-6aa6-471f-8732-4ac5494cd4ce","resolution":{"observed_at":"2026-08-01T07:03:33.402888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-01T07:03:33.478232Z","title":"arXiv preprint arXiv:2408.00714 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:33.478232Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:18071648d723ae9a4d0ebd4948d69cfe38070cbc05af9c546be64887539e9408","observation_id":"27baa4dd-7cbf-4199-ad7c-c285f22718a4","resolution":{"observed_at":"2026-08-01T07:03:33.478232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:33.531869Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:33.531869Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:e17df14e0cbf2b5dcf7863d0b8568f7a9222abcbc64470ae4c9d75ab2dee5b72","observation_id":"c8e39457-3259-494a-8e12-1ebec910a233","resolution":{"observed_at":"2026-08-01T07:03:33.531869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:33.596915Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:33.596915Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:0a33540b331e2e2f014d35c18836e48a341d099a3e9e224e2f140789060efa5b","observation_id":"daa3967c-67b5-44c0-ae92-f6011888df9c","resolution":{"observed_at":"2026-08-01T07:03:33.596915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:33.775388Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:33.775388Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:055f201a41a614a8b8a4200e7aebec3dff2e0b2970d9aeeb2387d6e062eff9da","observation_id":"0a227718-9b28-48ea-bc87-9526ea17e17e","resolution":{"observed_at":"2026-08-01T07:03:33.775388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:33.970417Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:33.970417Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:545352fb83d47c86d0ae76b42afb4deb13f4f5abc57a1cec08d643e0b29f1072","observation_id":"10111365-877f-4e23-82f2-19dc9d04bde9","resolution":{"observed_at":"2026-08-01T07:03:33.970417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:34.123096Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:34.123096Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:5e727fc6637258775aa2d0f651f8d640d9db6e61ac017c04e1590eb39c301646","observation_id":"3b45c6f0-76b1-48de-8954-655b0862ffd5","resolution":{"observed_at":"2026-08-01T07:03:34.123096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:34.266755Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:34.266755Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:ed4a302671c3cc3b24812e31399b11bb29c0f8e77997f8c3562c20ae03bc5a61","observation_id":"d10f8a41-507c-46e9-b5d7-593b5c7fa4cc","resolution":{"observed_at":"2026-08-01T07:03:34.266755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-08-13T10:44:26.934833Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-01T07:03:34.434298Z","title":"arXiv preprint arXiv:2508.10104 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:34.434298Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:b11c7c21ff402d00c0b35863372fcbf2e943ed9811255f14c7138b9d8bb0fdaf","observation_id":"173d0fd0-a0db-4704-91c2-c49b7d7704b2","resolution":{"observed_at":"2026-08-01T07:03:34.434298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-01T07:03:34.644062Z","title":"arXiv preprint arXiv:2011.13456 (2020)","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:34.644062Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:27703376e2946645904559d9451e0d1e91420ed1ed76525c09b410149dabe95b","observation_id":"db0c05e0-daf1-4352-8d60-f4f35465497c","resolution":{"observed_at":"2026-08-01T07:03:34.644062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:34.801587Z","title":"Advances in neural information processing systems36, 1363– 1389 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:34.801587Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:36b2fb2ab94df08190cd5a2fef472b7f2ccd2385a0aeedb2641048c7d2e3a352","observation_id":"97ab7d20-2eff-4a5c-977b-2f67f68631b3","resolution":{"observed_at":"2026-08-01T07:03:34.801587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:34.901767Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:34.901767Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:93d3af477d81907864b3587e833b09a8e70d745d19f447971fa3b07f94636b30","observation_id":"4abb1741-e845-4879-a47e-3cd39bbad76b","resolution":{"observed_at":"2026-08-01T07:03:34.901767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.00463","last_updated":"2019-08-29T04:17:49Z","snapshot_observed_at":"2026-08-15T10:05:41.585216Z","submitted_at":"2019-08-01T15:39:54Z","title":"DIODE: A Dense Indoor and Outdoor DEpth Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.00463","snapshot_observed_at":"2026-08-01T07:03:35.017675Z","title":"arXiv preprint arXiv:1908.00463 (2019)","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:35.017675Z"},"links":{"cited_paper":"/paper/1908.00463","citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:31dbe584087cfda39b4009bcc963b10862b68478bde6b13473b5379f40ae84f1","observation_id":"b05d6718-b485-4a01-89ab-063fcab033be","resolution":{"observed_at":"2026-08-01T07:03:35.017675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:35.149377Z","title":"In: 2020 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:35.149377Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:ed14992f13e3bcb6392ed4b7bb784415d0ba63db665b68f421f910c1176b6725","observation_id":"10710e67-4a97-4e99-bc4f-69274bedff46","resolution":{"observed_at":"2026-08-01T07:03:35.149377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:35.343734Z","title":"arXiv preprint arXiv:2506.20279 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:35.343734Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:f3303a447cd411458da01e734f01eddccbd799454b4169ce265c69e6eff4b36a","observation_id":"3989b8a6-187e-429b-86cf-b6ca3b4ec371","resolution":{"observed_at":"2026-08-01T07:03:35.343734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06090","last_updated":"2024-12-01T12:13:57Z","snapshot_observed_at":"2026-08-15T18:45:11.288114Z","submitted_at":"2024-03-10T04:23:24Z","title":"What Matters When Repurposing Diffusion Models for General Dense Perception Tasks?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06090","snapshot_observed_at":"2026-08-01T07:03:35.462630Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:35.462630Z"},"links":{"cited_paper":"/paper/2403.06090","citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:f0b2777660b0e66fb26ee394dbd193cbe5af16a143839d3ac722a6a3382ca7ea","observation_id":"bfb43521-67d6-4d4f-9e9c-c24acb63d4d7","resolution":{"observed_at":"2026-08-01T07:03:35.462630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:35.594350Z","title":"IEEE Transactions on Circuits and Systems for Video Technology34(2), 1228–1240 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:35.594350Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:7648476f7ba666a1842712bb395c0dff6fb875bff8306c3e0b09c107fc04c26d","observation_id":"e37bb9e9-dc9a-478c-9fa0-dd9a98ea72bb","resolution":{"observed_at":"2026-08-01T07:03:35.594350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:35.778898Z","title":"In: Proceedings of the AAAI conference on artificial intelligence","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:35.778898Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:e3bc81d043faf9df86ac405d4282e9d10206fc0a75947a537ab5d7968afcef24","observation_id":"74f5b4d6-fc5d-4b48-b43e-9275d543310c","resolution":{"observed_at":"2026-08-01T07:03:35.778898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10815","last_updated":"2025-03-12T09:16:59Z","snapshot_observed_at":"2026-08-15T10:36:28.640501Z","submitted_at":"2024-10-14T17:59:46Z","title":"Depth Any Video with Scalable Synthetic Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10815","snapshot_observed_at":"2026-08-01T07:03:35.892891Z","title":"arXiv preprint arXiv:2410.10815 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:35.892891Z"},"links":{"cited_paper":"/paper/2410.10815","citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:223c4cf0a234bc42b15839ab5664c1209eb33822bf0fd39ca9ca01454d0c2451","observation_id":"ec281368-f8d0-47bf-a5cb-7877bc2aaf0a","resolution":{"observed_at":"2026-08-01T07:03:35.892891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:36.011873Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:36.011873Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:cfce19c6aa37fa1e9ba81f4c5fb856924759cf27124921bc36c85463e41f8b53","observation_id":"4f503da8-f0f4-4757-93cb-a05c6ff85e6e","resolution":{"observed_at":"2026-08-01T07:03:36.011873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:36.085115Z","title":"Advances in Neural Information Processing Systems37, 21875–21911 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:36.085115Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:ae220020cd8789a5fa565187bd9a4432f2fc6b0628b568c1185a6b1dc03d8f6a","observation_id":"cdf66607-4975-4f40-bff7-e1c306a7042d","resolution":{"observed_at":"2026-08-01T07:03:36.085115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:36.148686Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:36.148686Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:381db9a16cf9c5e827180ed4a4614551add4edf92facd2ac831144edac59d8a3","observation_id":"101dc4ce-c3fa-4931-8c43-0f8ecbe18572","resolution":{"observed_at":"2026-08-01T07:03:36.148686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:36.221191Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:36.221191Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:8cab52946ff243c4dbe117d6b65ccab573254a95903647d97a2b980791bd5382","observation_id":"44dc7066-a93d-484d-89d1-3ff771c6ab66","resolution":{"observed_at":"2026-08-01T07:03:36.221191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:36.283996Z","title":"In: The Thirteenth International Conference on Learning Representations (2025) Unified Video Dense Prediction from Disjoint Data 21","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:36.283996Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:be5eafa2fecb8d01588b27d30c04c524e88339a14c908c3e77f31b1b051f23d7","observation_id":"24a44dad-3765-4c48-8c27-b988f8518a78","resolution":{"observed_at":"2026-08-01T07:03:36.283996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:36.393844Z","title":"ACM Trans- actions on Graphics (ToG)43(6), 1–18 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:36.393844Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:14f1f4de35140f346a7ed18de96bd81535226408c84c9f467fa39b0c386c74b3","observation_id":"3d896b31-83e4-4924-8b5b-e596f7361b63","resolution":{"observed_at":"2026-08-01T07:03:36.393844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:36.519725Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:36.519725Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:db4fc4c28c1027c98c051aafa29e2423f49309b0bc7d5c69ec96cfc9cff0d8a1","observation_id":"1a63e2a3-b653-43f7-b5c9-be09141b4618","resolution":{"observed_at":"2026-08-01T07:03:36.519725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:36.585503Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:36.585503Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:c968aabb76ce1a93913fa2a9191330c908e7ccefb5a74dcc8d0abe1f13bfd452","observation_id":"1c47d639-ac3a-4be9-b844-01a1983c35fc","resolution":{"observed_at":"2026-08-01T07:03:36.585503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:36.647472Z","title":"In: The Eleventh International Conference on Learning Rep- resentations (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:36.647472Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:9971b98b5c8e35e2bce753163bd60f02b06efdd7fca97694802483044075b5f2","observation_id":"2e89241c-34c3-4d29-89bb-11f0eaafd586","resolution":{"observed_at":"2026-08-01T07:03:36.647472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:36.757132Z","title":"In: Proceedings of the IEEE/CVF Conference on Com- puter Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:36.757132Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:57ef54df026fe781410c615335d06d40b5c76cc96db1d44ce1db015431fd8e55","observation_id":"269387d0-8375-4cea-ba84-34e5c2dd3ad6","resolution":{"observed_at":"2026-08-01T07:03:36.757132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:36.805980Z","title":"IEEE transactions on pattern analysis and machine intelligence 46(12), 7493–7508 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:36.805980Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:30c881a65372cd3df18cfdd1da92f075a15ce6e5e152b0f238af06aa91abbb1a","observation_id":"86083db4-2368-418e-a0d0-554d5ce83fae","resolution":{"observed_at":"2026-08-01T07:03:36.805980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-01T07:03:36.869795Z","title":"arXiv preprint arXiv:2308.06721 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:36.869795Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:ec898db7b3b62df01efdb7ffc7a8caf79afd7146e6677184b802294c58e4dbd3","observation_id":"cb304d69-43db-4aba-9cb1-5285f98e00bd","resolution":{"observed_at":"2026-08-01T07:03:36.869795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:36.935676Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:36.935676Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:98574bd8c57e49d3f68f04c6c545a497bc0d3a9c9531a545b302c2e6585f413d","observation_id":"7e0d9d71-b2d1-45a5-9fa6-a99b5cd12123","resolution":{"observed_at":"2026-08-01T07:03:36.935676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:37.062052Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:37.062052Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:ed367018ee90b1adcbdc7fd995b5eb83ab77785487d491dd08e2503a5a92597c","observation_id":"fb0a4486-f8ab-481f-ba61-f4b11a57634c","resolution":{"observed_at":"2026-08-01T07:03:37.062052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:37.187275Z","title":"arXiv preprint arXiv:2502.17157 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:37.187275Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:a5f6bbf20d464710dd5303879070762ac9836f2d1f4bc3f910e93e6627e297e5","observation_id":"0d526bba-63c1-432a-9b7c-350ca180e489","resolution":{"observed_at":"2026-08-01T07:03:37.187275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:37.248983Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:37.248983Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:0e0c86664c96c1351b070c050f812f4769b063f597af8d97a43e977829a574a2","observation_id":"b99ecb89-87e0-4059-870e-cd1bd3e97a42","resolution":{"observed_at":"2026-08-01T07:03:37.248983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:37.292461Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:37.292461Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:8aa3b519e1c29a36acd5c11d0a7a0a6f5cef33b1fc828d73f76dee77564dfdf5","observation_id":"0aa2e65b-9d04-4c3e-a93a-9ae3206d3d05","resolution":{"observed_at":"2026-08-01T07:03:37.292461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:03:37.371525Z","title":"video_dense_pixel_prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-01T07:03:37.371525Z"},"links":{"citing_paper":"/paper/2607.21592"},"observation_digest":"sha256:5322a350070697c6a51ebb08907e209a386bbd9fd92e4ba12c69b9b8f93f59bf","observation_id":"5ce5db16-5b7f-48b6-bcac-5cf68818fa4d","resolution":{"observed_at":"2026-08-01T07:03:37.371525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.21592","last_updated":"2026-07-23T17:59:50Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T09:51:01.969146Z","submitted_at":"2026-07-23T17:59:50Z","title":"Unified Video Dense Prediction from Disjoint Data"},"reference_resolution":{"displayed":93,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":93,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":93},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 93 of 93 outbound references and 0 inbound Pith citation observations for arXiv:2607.21592."}