{"as_of":"2026-08-09T23:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:29569f199d9c00c954e7fc9baef08c9ac9bc86b20d817499da96d15e57e454a2","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:45:22.211214Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.12795/citation-record","integrity":"/paper/2507.12795/integrity","json":"/paper/2507.12795/citation-record.json","paper":"/paper/2507.12795"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:15.926372Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:15.926372Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:0569d476372310cd394978f2db05a55464fc9ab7185ebe7f4b2249ac492f43d1","observation_id":"5cabfe07-63dc-48c1-b12f-7fa7fdfbfa8f","resolution":{"observed_at":"2026-08-06T16:45:15.926372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:15.975258Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:15.975258Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:870b2a50f4c7e3d2d1f50cbf7b8a229862a4363433f0d663f36497eea5ad2291","observation_id":"9163f18f-439f-4a1a-a367-891709a131d9","resolution":{"observed_at":"2026-08-06T16:45:15.975258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:32.376627Z","title":null,"venue":null,"work_id":"024d1574-515c-4260-91b3-b1fc1b13dfef","year":2018},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:16.097689Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:7a4c4530ed85a4577a827bc08aee7f5fd566e3dc84bd1c86a6f37252ecfc8a35","observation_id":"40ac0bb8-09e1-44fb-827c-3c79499f9bbd","resolution":{"observed_at":"2026-08-06T16:45:32.459867Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:32.199086Z","title":null,"venue":null,"work_id":"1a24645c-adb4-4a3d-80df-6533f352a525","year":2016},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:16.188899Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:b597dde61ff0fedd56c2d8e17514c1c1b852b2827439bd35a7eaf429925804e5","observation_id":"b5560e39-d534-4b24-af6b-44976c3c188c","resolution":{"observed_at":"2026-08-06T16:45:32.277131Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:32.082157Z","title":null,"venue":null,"work_id":"02048adb-1711-47fa-abe0-e0a1d0a93a48","year":2022},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:16.236723Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:8b31c20340ca4464d6825c5e354bc772f32f09f697811650ddbe2fc76449a8aa","observation_id":"4c8d87c2-0e6d-44fd-bfd2-2b9db1df90f0","resolution":{"observed_at":"2026-08-06T16:45:32.126470Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T16:45:16.290157Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:16.290157Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:f45c618b32e840d0362a552d998ab03c45a6b1c861e181eff1135fa5e1cc0d09","observation_id":"2ff4600c-d785-4286-bda9-0ecdb7dd4e1b","resolution":{"observed_at":"2026-08-06T16:45:16.290157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T16:45:16.361628Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:16.361628Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:de0dae30d4576d555c20ac6c684d954417ddaf19b69529bd15a92013356e16f0","observation_id":"bc08b78f-8287-468c-921d-e252b132bbbc","resolution":{"observed_at":"2026-08-06T16:45:16.361628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:16.427392Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:16.427392Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:9cf38c5652959c527f4b615d6ee5aa1c91779bc37284ee1e92cb49b75dcc90c7","observation_id":"e2f454b3-038f-4251-a997-969bce55cd74","resolution":{"observed_at":"2026-08-06T16:45:16.427392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:16.486408Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:16.486408Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:214e1f55a2582a1d7a27a9fa1c12a4476c23732773c10950e6b77da03e4becaa","observation_id":"29fd16d8-2ba8-4a4c-a769-21156eceb1ac","resolution":{"observed_at":"2026-08-06T16:45:16.486408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:31.919420Z","title":null,"venue":null,"work_id":"bc1be173-16ce-4c2d-96ab-6260e1b1c877","year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:16.567081Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:2a4788d86f8016891629ee73d98034f78ed860e256762fce149e85c0a192a69b","observation_id":"f3a1ae20-f413-4678-9e02-e6f4dff14dc8","resolution":{"observed_at":"2026-08-06T16:45:31.982521Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:31.788428Z","title":null,"venue":null,"work_id":"17e1cd10-154f-4f3d-ac6a-f23b58baf5d6","year":2017},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:16.622039Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:654724e29a789b3ad4773f649152825fab5526f44f7a865a5447186d0ca1a467","observation_id":"58f04d5b-aff1-4d99-a176-4c54f1b802a0","resolution":{"observed_at":"2026-08-06T16:45:31.857384Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:31.612957Z","title":null,"venue":null,"work_id":"6e5bbf42-12ad-4ccf-90e8-bdbbdf3545e6","year":2020},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:16.689807Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:9bf257005fe08b4d4bbe4be890ec362a74d89851eb1edb2b23098276558372b8","observation_id":"1bf11dc2-c795-429d-bb25-ae0afead40ca","resolution":{"observed_at":"2026-08-06T16:45:31.693296Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:16.761439Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:16.761439Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:2edf33fc81800493a1ff2039ec3bf0c66cfd4075b26af8bb63d145b2636d7675","observation_id":"b476bbed-a8e6-413d-a0d8-1f68d48f37c2","resolution":{"observed_at":"2026-08-06T16:45:16.761439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:31.465283Z","title":null,"venue":null,"work_id":"15e24048-992b-4b8e-8148-72443dab15e4","year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:16.831029Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:d8f37d1f292b33a1d9ebd6d9eb8f3e6bc2166a9a21fa972776a93075e983f7af","observation_id":"cf447c39-d028-4f96-9bae-a35147654b58","resolution":{"observed_at":"2026-08-06T16:45:31.536118Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:31.317369Z","title":null,"venue":null,"work_id":"7d8e16aa-d08c-4c30-a6e8-11390b7ab8c0","year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:16.908282Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:a2ed6ffb0869ec87b2f190953982e683840250ef9ecc91530420b3ec7ab9d223","observation_id":"07a187f7-216a-41b9-a1ce-181377c4166f","resolution":{"observed_at":"2026-08-06T16:45:31.377050Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:16.983920Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:16.983920Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:03e8f849a833e485b59a7f9c41ab8cacd8ff478515c34517d3b81403d6d9da84","observation_id":"b8aaf4a4-635a-4a5e-a68c-38c61828479c","resolution":{"observed_at":"2026-08-06T16:45:16.983920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:17.050661Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:17.050661Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:6421cd53d4f0dce33df1d3a7781db005d6bfb00e711c9454db8bc62489eefeec","observation_id":"c3b18ace-0b03-4f55-8dcb-2be2dee8a3d5","resolution":{"observed_at":"2026-08-06T16:45:17.050661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-06T16:45:17.142840Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:17.142840Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:b6accc417331cbd8aa12bc037ba0fa926c3fdb17f0f98ca0bb4f59b4d96b0432","observation_id":"8cefdd84-1cc7-457e-ad78-8eef5455f46f","resolution":{"observed_at":"2026-08-06T16:45:17.142840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:31.174777Z","title":null,"venue":null,"work_id":"1063dbc9-88d8-4ffa-8f2b-3284a37e95b7","year":2019},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:17.210296Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:e45729f0bdedc5ea592d3893e7ac68a9b62a8ac0972b8d23be7e60f6196b89ab","observation_id":"eb96e898-2e73-48e9-a1ee-d63c58d7f44e","resolution":{"observed_at":"2026-08-06T16:45:31.230235Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T16:45:17.284784Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:17.284784Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:2eafbd477276bd2b87141558ba92a0948a00da0382e04338b6d2743b365e1978","observation_id":"8b6e5fd5-a0ee-46f9-bd5a-29ae0e100fd0","resolution":{"observed_at":"2026-08-06T16:45:17.284784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:31.047546Z","title":null,"venue":null,"work_id":"d0648cc4-d552-4162-9d27-2e7fb1f04d65","year":2022},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:17.375198Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:4676ddeab9bd2002e59cb590ccc17d715746b2e9ce78498e43852e080a76e59c","observation_id":"aa327707-65a5-456f-9818-c42f7c8a87c7","resolution":{"observed_at":"2026-08-06T16:45:31.089876Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11401","last_updated":"2024-03-22T18:52:51Z","snapshot_observed_at":"2026-08-06T11:39:56.281668Z","submitted_at":"2024-03-18T01:18:48Z","title":"Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11401","snapshot_observed_at":"2026-08-06T16:45:17.450944Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:17.450944Z"},"links":{"cited_paper":"/paper/2403.11401","citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:3a47ec3fa39e87a304e7304f1e8a2f913f24ff39444206eff4df7ce66bfacb61","observation_id":"4ce50cf9-d531-4676-87af-641df8bb2212","resolution":{"observed_at":"2026-08-06T16:45:17.450944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:17.516954Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:17.516954Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:e67be5478e4159fcc4d55d6a54b8835bf57c902c04c786f8de2d1247d44c95bd","observation_id":"077ddc26-e83e-4d8b-9767-af521eb6f5a1","resolution":{"observed_at":"2026-08-06T16:45:17.516954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:30.923229Z","title":null,"venue":null,"work_id":"34619298-122e-48bf-a137-fb876f7c7051","year":1995},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:17.597601Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:cc6eb7cc462bf11c102817dd225c8fc7adba01a2c20a660c260b603ba478df01","observation_id":"066e2892-ece8-4cea-add0-8edf5d9fab10","resolution":{"observed_at":"2026-08-06T16:45:30.986394Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:30.767439Z","title":null,"venue":null,"work_id":"05aadf0a-6390-463a-9c04-fddb71345fb1","year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:17.758175Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:ffb3a90f81c21ecc9ec6da1883a2dc2a3accaebada02af6b3bcb6ceb256a08ba","observation_id":"1acb98ca-a456-435f-852c-e85608c7820d","resolution":{"observed_at":"2026-08-06T16:45:30.831423Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:30.621764Z","title":null,"venue":null,"work_id":"fd7728c2-e487-49cb-ae9d-31747a686af0","year":2021},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:17.917994Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:471f100cbbdb53c5254ce852a83e1d159299b48842bcfc779231fd98323d716c","observation_id":"562841d6-7fd1-4849-8887-06b33a05202b","resolution":{"observed_at":"2026-08-06T16:45:30.683596Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:30.457170Z","title":null,"venue":null,"work_id":"992b4243-20b0-487e-9739-47675d35d5ca","year":2022},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:18.046896Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:ef0d7d1ef246bfda7dada5004779f9f63d3bf62bbd17858d5e8d31a58563fe00","observation_id":"090c0dbc-592c-4645-a8f2-8e1a83d0301e","resolution":{"observed_at":"2026-08-06T16:45:30.512480Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-07T17:07:05.445620Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-06T16:45:18.210032Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:18.210032Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:b4156fa48dccd8a77de4e4c8b0bc4f4bf813de711c9dfc7242148d9687b0b9e0","observation_id":"fc0b60dd-6355-4a7b-af04-d789863647da","resolution":{"observed_at":"2026-08-06T16:45:18.210032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11790","last_updated":"2022-06-16T09:15:52Z","snapshot_observed_at":"2026-07-06T12:21:28.059661Z","submitted_at":"2021-12-22T10:48:06Z","title":"BEVDet: High-performance Multi-camera 3D Object Detection in Bird-Eye-View","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11790","snapshot_observed_at":"2026-08-06T16:45:18.339404Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:18.339404Z"},"links":{"cited_paper":"/paper/2112.11790","citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:dfb196931c38853f606686ca2fd2a428dbc28a07ca5844ae45d191df3d9da24a","observation_id":"bd9c05be-eaa7-46a3-9bfd-7d71c7b84139","resolution":{"observed_at":"2026-08-06T16:45:18.339404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:30.302667Z","title":null,"venue":null,"work_id":"fe1aee4e-97db-4ce4-8f25-96d828ebac1e","year":2018},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:18.442216Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:207f34b96b600b358536bda3efe87ca663b5b4c6e1f0bbda470f067b2c3aaa2a","observation_id":"dfd421e6-4d94-401b-889b-5176be923796","resolution":{"observed_at":"2026-08-06T16:45:30.374438Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:30.148874Z","title":null,"venue":null,"work_id":"c166b710-888d-49b6-8154-9a7fbaacbb9f","year":2023},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:18.555693Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:470057cc7de09dfd977e9ae499d2649daffbb5ccbb03fe4b586832334f56bb5b","observation_id":"71a22c9c-29a8-4dd1-a9b2-de44d647a08b","resolution":{"observed_at":"2026-08-06T16:45:30.248872Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:29.989584Z","title":null,"venue":null,"work_id":"dbece49b-b4fb-41d9-af34-6a73036c636c","year":2023},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:18.667641Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:b134c79a6896a22239e08a9a0d3e89b1de267fc5645b7dc0ce38c89a6274c94e","observation_id":"3ab6fcf1-1d42-41a3-bff6-202184eb76a3","resolution":{"observed_at":"2026-08-06T16:45:30.053271Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:29.842294Z","title":null,"venue":null,"work_id":"9693c50d-823f-4337-ae75-88f2fa708ba4","year":2018},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:18.829580Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:d6caf58c6d176349b379cf5ded0dc75c49ab385295393dd661f9663346b51c28","observation_id":"efe47dd2-d2fa-479c-a643-b6d4f80c138d","resolution":{"observed_at":"2026-08-06T16:45:29.939648Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:29.657490Z","title":null,"venue":null,"work_id":"dea8f403-9d13-407b-904f-68a371c04d78","year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:18.948454Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:3e242614f45fdd4a5684522ace4371e7f83bff7a89d1ea17a0805adc15aab3a7","observation_id":"dcaf465f-bc98-4209-ae98-bb0176cff2dd","resolution":{"observed_at":"2026-08-06T16:45:29.756108Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-06T16:45:19.059261Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:19.059261Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:294495ee3a7a808ac6a0f48cd32e8cc931145d1125d03996f450f2b65957b8f2","observation_id":"aa0fbf22-1915-4af8-a734-10a6f04685d2","resolution":{"observed_at":"2026-08-06T16:45:19.059261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:29.495209Z","title":null,"venue":null,"work_id":"35d4b340-c9fb-41fb-a987-2b3c0559a947","year":2022},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:19.125318Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:d950ff9afa37888c0c9af433721628a9ca3e07c5d79d2ac2f717ca90cd6e0915","observation_id":"1c9d1f3a-c026-4267-8dcf-5baab768ca28","resolution":{"observed_at":"2026-08-06T16:45:29.577752Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:29.367615Z","title":null,"venue":null,"work_id":"78ba7014-8f98-4432-936c-39dc88e12776","year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:19.191378Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:112e542bd8495b6e557671b70661fbd823cb723759eb041785523edf1a6bd3fa","observation_id":"b22e5b48-3f1d-4ee5-9306-74b105e135ee","resolution":{"observed_at":"2026-08-06T16:45:29.440462Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:19.252146Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:19.252146Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:105f29183e6ebadee8dab633909fd0918817f44937e5484a5b398b6566efede9","observation_id":"3bc864f4-bbd2-4213-8abe-0763394b569a","resolution":{"observed_at":"2026-08-06T16:45:19.252146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:29.226162Z","title":null,"venue":null,"work_id":"39c1981a-f7f8-45f0-9101-50a64ab39de8","year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:19.316279Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:e6883ce1e4108713e04d8c39677e34af22028a3ace5d67fd477a611d1b7171d0","observation_id":"b132d912-109d-4d4e-ad00-262a3f50ad19","resolution":{"observed_at":"2026-08-06T16:45:29.303415Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:19.380319Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:19.380319Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:ef74620d2cd6b2a1b359ef2f7a179f04d7e1a62437a7319ee454e1eacd9cc378","observation_id":"d1be0de6-e45a-4b6e-93c8-e949f797ba95","resolution":{"observed_at":"2026-08-06T16:45:19.380319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:19.484626Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:19.484626Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:330ff67d678e23ab4a17581f7b37cd30d3f2984bd32d9b4bf4e3f9b18fd717f1","observation_id":"f4284025-4208-4ba3-860d-22d7ce80f387","resolution":{"observed_at":"2026-08-06T16:45:19.484626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:29.032791Z","title":null,"venue":null,"work_id":"c7c02a0c-5850-43fa-8ac3-6b69bd888335","year":2020},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:19.582354Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:39ac14aecd395c746265677423219e01f9b1f4d9229d7abc9c0f5fb6595054be","observation_id":"67b3f8db-771c-45f5-8a2c-ed85d5306eb9","resolution":{"observed_at":"2026-08-06T16:45:29.111064Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:28.921741Z","title":null,"venue":null,"work_id":"f84056c1-0150-4dd8-b567-165155c69aee","year":1999},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:19.654849Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:c2856b53b6d24cf63c8bc5f6a4e0814d0fee266f1c50ec87b42aa6a5c86db30b","observation_id":"903c5778-321a-4b6a-9990-71477bca37d7","resolution":{"observed_at":"2026-08-06T16:45:28.977218Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:28.750499Z","title":null,"venue":null,"work_id":"0c651642-7b18-4d77-b49c-e4951b2ec109","year":2011},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:19.706052Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:107b358b2e0b1877459ea4ac9220245523a68523a21a1c79005e033a555e0552","observation_id":"b1fcfe1f-c8a3-46e0-88f5-54d3be8cfb92","resolution":{"observed_at":"2026-08-06T16:45:28.825248Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:28.624332Z","title":null,"venue":null,"work_id":"b515463f-3d5c-41e1-adc7-f7d4b13a9d94","year":2021},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:19.766681Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:af5d88b55f90c34462ff0bddfbb26957e8374d67ef79ef095dc18cace5a6dc12","observation_id":"421ad23a-828c-42e1-84ff-7d14c0e04b35","resolution":{"observed_at":"2026-08-06T16:45:28.689472Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:28.456188Z","title":null,"venue":null,"work_id":"0b947f6c-b4d1-4d99-aef3-842dd5901710","year":2023},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:19.826604Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:004681bdb433a525f7e2ef4b7792741fc2288a64419f643c35df1b87b6602259","observation_id":"cb8bee88-cded-4d60-b2ef-80001ab964c0","resolution":{"observed_at":"2026-08-06T16:45:28.553173Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:28.328203Z","title":null,"venue":null,"work_id":"9d0c02f5-13e1-45d2-987f-bfca0643bef8","year":null},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:19.970555Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:df24f9d93c2a29df6516a6f747756553411362c9d23ce526dc747d02e7c90963","observation_id":"0bc2cbd8-b484-4bd4-9578-f1c8abcca316","resolution":{"observed_at":"2026-08-06T16:45:28.381221Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:20.151972Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:20.151972Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:84e6ec3994b48d0c95eb1b67328020d363170bca760c1e3a6577dd921a8063d6","observation_id":"3825d085-e821-44c3-bbef-26ad8bde2bc1","resolution":{"observed_at":"2026-08-06T16:45:20.151972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:27.968405Z","title":null,"venue":null,"work_id":"221f3f6f-024b-423b-9ab3-024a28ba8744","year":2021},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:20.236584Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:1be1acc02becf48779a2cafa70aa4fbb3cd56b9c3dfeb8df81ec2d534d6640e7","observation_id":"67bc1af9-3e9e-487c-aef1-97747b9135d0","resolution":{"observed_at":"2026-08-06T16:45:28.091116Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:27.689327Z","title":null,"venue":null,"work_id":"0e5e075b-7173-4e9f-8f30-e56d8801a554","year":2023},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:20.315156Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:0d7437c261c076c4525d93da39ba3d6bec550a1213db3345a0ca49d4183852b3","observation_id":"b4c2b2cf-9e86-4afd-b2f5-62ab51ae2448","resolution":{"observed_at":"2026-08-06T16:45:27.812568Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:27.477757Z","title":null,"venue":null,"work_id":"b025aebb-5204-46b4-88b1-85cd0e2675bd","year":2020},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:20.389627Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:25b8677ec6d408ba58fa35affdf6b420a9d91797f65232264e9a64938ce579a4","observation_id":"3ab811ba-29c0-43f2-8dcd-de372c7dd98c","resolution":{"observed_at":"2026-08-06T16:45:27.551046Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:27.192848Z","title":null,"venue":null,"work_id":"985d059e-8db9-445b-95af-d66643240d9e","year":2022},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:20.462200Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:85c0c31870ab1ed49af42aa7cb24b05c5cfa51348b7a142c8d931d65f139e7c5","observation_id":"fa89783d-1fd1-4d83-bb60-d0bb0eb725fd","resolution":{"observed_at":"2026-08-06T16:45:27.310408Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:26.938408Z","title":null,"venue":null,"work_id":"a55af18e-d09d-42bf-9b46-f4c47dd4fb48","year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:20.551339Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:0c39a3dadf85f4d7c5caed76e48f2781f3149dc4cf72a9b5ce1f441a3381b01e","observation_id":"0bbf035d-3d6b-46a5-b355-7f0093fa9515","resolution":{"observed_at":"2026-08-06T16:45:27.031507Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:26.695306Z","title":null,"venue":null,"work_id":"40577e0e-596e-449d-b716-5bc0eeb38c0e","year":2021},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:20.608888Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:6ff4c606caa79e886bd749e160adc9c07f02b3fcbeb4551616ddee50b9b24c1b","observation_id":"ab70056c-74b3-4771-b5e0-41e0ab1a23af","resolution":{"observed_at":"2026-08-06T16:45:26.816257Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:26.409357Z","title":null,"venue":null,"work_id":"1e9eaaa1-483d-4dd0-ab9d-5fc21068114c","year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:20.669773Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:55e3e067bebff2cc1bea01d6002610ab6ed9cb4620adf156c010da695f2d2a80","observation_id":"999ec2fc-96af-454f-b183-9446912f508c","resolution":{"observed_at":"2026-08-06T16:45:26.558919Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:26.141573Z","title":null,"venue":null,"work_id":"fe59edf0-ea45-4e60-8eea-83b6eaf0bf0c","year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:20.739745Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:1bfa8d0fd3486d663d9fd2146cf3d66c75123373c9664bcd8aa8c2ec7980a301","observation_id":"ee0e4d5c-e92f-49c3-8fe6-22bc3f25eec1","resolution":{"observed_at":"2026-08-06T16:45:26.294311Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:25.822881Z","title":null,"venue":null,"work_id":"de4c7d61-3d81-4a0b-b942-3927a53dee6e","year":2022},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:20.799778Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:9d7eec1f9369f276da77e157ea8a4130c0e154deb67a72b7e1be988b1c6b9605","observation_id":"c8d1f276-513c-41b5-a981-3f54fbfed5be","resolution":{"observed_at":"2026-08-06T16:45:25.991752Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T16:45:20.869994Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:20.869994Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:a2be0af2626d1845aca02321359b54527d91d32ff1626c166a600a65c51a9e6b","observation_id":"18185502-ec8a-4315-abcd-b50fea463acc","resolution":{"observed_at":"2026-08-06T16:45:20.869994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:25.558685Z","title":null,"venue":null,"work_id":"72965c66-b012-4ce6-8ab4-3cdaa7be7af5","year":null},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:20.922932Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:a0b61e8ae65e3b4312fbd4bc764638606e75a34303755763578028cf0c6b1271","observation_id":"20977e04-1194-4894-ac6c-2c707cba5bf0","resolution":{"observed_at":"2026-08-06T16:45:25.632606Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:25.274311Z","title":null,"venue":null,"work_id":"994453ac-b9b3-4907-9a10-5b2653ca445e","year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:20.992599Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:178c3999d58bbed0b55117f7af60d90f5fb859b823e44e4e8441bd6deaae3d84","observation_id":"d206b60e-78b7-45aa-a9c7-c3dd508bb03b","resolution":{"observed_at":"2026-08-06T16:45:25.444651Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:25.026913Z","title":null,"venue":null,"work_id":"5af38484-94d8-4b7d-852b-f7aa4956580c","year":2021},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:21.059065Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:def79d011c1621e0896bf8b304331e18a3111091e7dbe309a94adccafe86492b","observation_id":"a742505e-bbed-4fb8-9b0c-9e42e7b5b6b2","resolution":{"observed_at":"2026-08-06T16:45:25.135740Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04458","last_updated":"2024-07-05T12:09:33Z","snapshot_observed_at":"2026-08-02T06:29:22.518474Z","submitted_at":"2024-07-05T12:09:33Z","title":"Robust Multimodal Learning via Representation Decoupling","version":1},"cited_work":{"arxiv_id":"2407.04458","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.04458","snapshot_observed_at":"2026-08-06T16:45:22.353824Z","title":"Robust Multimodal Learning via Representation Decoupling","venue":"cs.CV","work_id":"4dcdeca2-11e8-4e3d-9d56-a1f4f7e3d0f4","year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:21.160113Z"},"links":{"cited_paper":"/paper/2407.04458","citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:cf3f272fa2a0d8b3b61fb3c106ac01d6d6e855005c86e94edffe2ee1e0400240","observation_id":"16fed420-6fc8-4b77-85c8-46e4f6c3bc92","resolution":{"observed_at":"2026-08-06T16:45:22.401236Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:24.817899Z","title":null,"venue":null,"work_id":"2f51de2a-6f89-435f-9797-d97cd0605cae","year":2021},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:21.225510Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:920ee14c9083394e15c8c75bdbf37bd92ae13eb95ca0aa70130171869f4b49c1","observation_id":"e4532737-1946-44f9-b2ff-438b1060446c","resolution":{"observed_at":"2026-08-06T16:45:24.899130Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:24.558495Z","title":null,"venue":null,"work_id":"9c085b9d-d117-4017-a493-fb45cd0d0f69","year":2020},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:21.258984Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:e6a27069271bf2e693c2f9701d416a1977a29fa0ca85b7be28904b89b2d49ce2","observation_id":"5bd510d4-0a23-4193-aed4-f93d164ab97d","resolution":{"observed_at":"2026-08-06T16:45:24.708235Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:24.308499Z","title":null,"venue":null,"work_id":"96791ad9-231e-4754-b6de-655520d6f79e","year":2023},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:21.315009Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:b8ccff9c1e486f147aa0e658f084e1652e3c6c47b2fb15d0730e7832e0b05c41","observation_id":"441a7ceb-574a-4099-ac00-884656eaf06d","resolution":{"observed_at":"2026-08-06T16:45:24.416367Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14074","last_updated":"2023-12-21T17:52:12Z","snapshot_observed_at":"2026-07-06T17:06:41.478216Z","submitted_at":"2023-12-21T17:52:12Z","title":"LiDAR-LLM: Exploring the Potential of Large Language Models for 3D LiDAR Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14074","snapshot_observed_at":"2026-08-06T16:45:21.383374Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:21.383374Z"},"links":{"cited_paper":"/paper/2312.14074","citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:29d0ce03b6e89203ec40411181b2d6e05059764764839c649c7ab6be769220ca","observation_id":"d8b4ee8e-ad7c-4a73-bbc2-6a7c255d168d","resolution":{"observed_at":"2026-08-06T16:45:21.383374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:24.066412Z","title":null,"venue":null,"work_id":"f569ef6c-2ca3-42bd-83dd-e724658d3249","year":2016},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:21.416957Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:94a35a275b97db20b9bbcfacfe0fed9804b25bdbeb62a1f56520505b92c01ba1","observation_id":"f1f1d78f-5a43-44e5-8a0b-6f29d66b3e8e","resolution":{"observed_at":"2026-08-06T16:45:24.171130Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:21.485558Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:21.485558Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:fa65d1a52315c57d8b600225d8734d58377412d3e450849eda83efda6f5d03b3","observation_id":"1769171d-d96f-4f9b-8f8c-9e8c99980236","resolution":{"observed_at":"2026-08-06T16:45:21.485558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:23.820320Z","title":null,"venue":null,"work_id":"3aca624c-2486-46d6-8be0-4eb8a4e3aca3","year":2023},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:21.511078Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:47a2cfbf8e7be4fae5852e8037847c1c939f323ddcf170467f615122e82f0a92","observation_id":"a82ce2a3-83e5-4142-9bd2-fa4f4afbb70c","resolution":{"observed_at":"2026-08-06T16:45:23.960329Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:21.606049Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:21.606049Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:1de393729150a1bc62c565fc1ea5007c4221e479e71af31c23025b4cc71edadb","observation_id":"2059dc24-67ec-4f3b-a5bb-83e453513350","resolution":{"observed_at":"2026-08-06T16:45:21.606049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:23.515885Z","title":null,"venue":null,"work_id":"f5c368dc-ee17-4ff7-af92-848529bd6c9b","year":null},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:21.699540Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:99d635c25093f93d9c800a7e612de0d12e4f55a309c15ab260d4961490f62620","observation_id":"55042e15-5de5-40ed-a2e2-fdc29a64e057","resolution":{"observed_at":"2026-08-06T16:45:23.667374Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:23.015859Z","title":null,"venue":null,"work_id":"68a48143-cd28-46e4-bfbe-a985939683d8","year":2021},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:21.952581Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:a99167c51405d231b4e8fcd54222a7dd2ffc6b3cb995340e358029ec599df28c","observation_id":"3a735be3-68cf-453b-baea-4b87f1a383ed","resolution":{"observed_at":"2026-08-06T16:45:23.187822Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:22.789664Z","title":null,"venue":null,"work_id":"5efe37cb-d095-4c7d-b024-1f4002ef7d9a","year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:22.108246Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:64a61e1784fc5c3055f90af8be6cd198612a75dde9150c292e4d9e0fde4dafe6","observation_id":"3ce759fc-f905-4f33-bf28-3808fec2ca31","resolution":{"observed_at":"2026-08-06T16:45:22.894682Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:22.602412Z","title":null,"venue":null,"work_id":"95ed2183-e326-4dd1-86b5-baa8b1733f22","year":2023},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:22.211214Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:5d3b64b6d913c74d119b6b598c0178139daffd935176f56aa1d31789de4dcaf2","observation_id":"41a12ddf-b7db-4e14-b365-e90ece3c2daf","resolution":{"observed_at":"2026-08-06T16:45:22.696752Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:16.040975Z","title":"Advances in neural information processing systems 35 (2022), 23716–23736","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:16.040975Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:23cd076aeffd4895193ef0788b9da1946d59a7d3a0845c6d397d1b207a18a90f","observation_id":"72aaaf21-c7a1-4f50-a317-44d8ad4c78a0","resolution":{"observed_at":"2026-08-06T16:45:16.040975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:23.321189Z","title":"Remote Sensing 15, 15 (2023), 3871","venue":null,"work_id":"999eb7b7-aaf6-43a6-9c2c-61235aa1019d","year":2023},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:21.815737Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:74af748080f5df7d624d0cb481a3c65ed68d17f55c5974c1cf2c79c99fc882e5","observation_id":"d511d5a4-cfda-48fc-bd27-5871c092fbd5","resolution":{"observed_at":"2026-08-06T16:45:23.432486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:28.171820Z","title":"In Proceedings of the AAAI Conference on Artificial Intelligence, Vol","venue":null,"work_id":"2efc8341-cf4e-4103-97ee-2ccf747e6602","year":null},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:20.061931Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:80cff3fb53c8c71c96326b05e2cabb217f5b820474d32335e5624fecaba0c0a3","observation_id":"3abea8d3-3090-4adb-b5c2-649c3fc5e8ce","resolution":{"observed_at":"2026-08-06T16:45:28.241590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T04:44:49.670290Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":74,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 0 inbound Pith citation observations for arXiv:2507.12795."}