{"as_of":"2026-08-19T00:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aa463f5d71f1afafb58be6aa30eb768e598b0cf0cebdd6b5dc40b5c49173a3ee","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:59:11.056801Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T02:44:27.661049Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-16T14:35:06.515561Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-12T05:26:19.602076Z","title":"Chat-3d v2: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00493","last_updated":"2025-03-27T10:30:42Z","snapshot_observed_at":"2026-08-17T23:18:17.356871Z","submitted_at":"2024-11-30T14:28:53Z","title":"Video-3D LLM: Learning Position-Aware Video Representation for 3D Scene Understanding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T05:26:19.602076Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2412.00493"},"observation_digest":"sha256:3d54e4f062059a858a5d3aaacc5fec0d51af1022846e7bc53822172b6f036c1b","observation_id":"f82e33e3-62e5-412a-8276-a6204f0f24b7","resolution":{"observed_at":"2026-08-12T05:26:19.602076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-16T14:35:06.515561Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-12T04:35:36.858454Z","title":"Chat-3d v2: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-18T06:32:16.050485Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.858454Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:0d96b6f124722d1d61e384d95ee81303ddb2a02c4e2aba1b18ccc7928d1e6283","observation_id":"27f7e11d-5cba-4ba7-9b8b-aa69f5a921d3","resolution":{"observed_at":"2026-08-12T04:35:36.858454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-16T14:35:06.515561Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-11T23:35:20.333277Z","title":"Chat-3d v2: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.333277Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:7d093ea99f3b6624620c1c4625799a94e20341d771004ed6dd36ffeaa67afcd3","observation_id":"9ea74b37-bbbf-49b7-9edf-769a8dc1b8c2","resolution":{"observed_at":"2026-08-11T23:35:20.333277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-16T14:35:06.515561Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-11T11:54:12.155293Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14837","last_updated":"2024-12-19T13:27:58Z","snapshot_observed_at":"2026-08-18T11:09:30.666072Z","submitted_at":"2024-12-19T13:27:58Z","title":"ObjVariantEnsemble: Advancing Point Cloud LLM Evaluation in Challenging Scenes with Subtly Distinguished Objects","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T11:54:12.155293Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2412.14837"},"observation_digest":"sha256:7a262b4f1660645a3f551b17dc56a8bfd7d168355e89195bc87416ca7cc367a5","observation_id":"f217f645-8772-4c3f-85ee-db2aaee3defc","resolution":{"observed_at":"2026-08-11T11:54:12.155293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-16T14:35:06.515561Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-11T04:45:36.679239Z","title":"Chat-3d v2: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.679239Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:d99c5c7971749626435fce99c53a1a6f665c4934f96fd892a0b4d9614dbdf613","observation_id":"f4b82864-43c3-4d00-96bb-a77d840c7f12","resolution":{"observed_at":"2026-08-11T04:45:36.679239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-16T14:35:06.515561Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-10T22:32:55.326487Z","title":"Chat- 3d v2: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01428","last_updated":"2025-03-11T07:54:04Z","snapshot_observed_at":"2026-08-15T04:16:11.827389Z","submitted_at":"2025-01-02T18:59:59Z","title":"GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:55.326487Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2501.01428"},"observation_digest":"sha256:5b647cb416ece94cb2c93b6afd76c5e1275a6416605b016fdb046f4fb2f42ded","observation_id":"a3309f5f-4320-43eb-b769-a4b8ef653210","resolution":{"observed_at":"2026-08-10T22:32:55.326487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-16T14:35:06.515561Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-10T21:48:27.009762Z","title":"Chat-3d v2: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03879","last_updated":"2025-01-07T15:42:32Z","snapshot_observed_at":"2026-08-15T00:27:44.617873Z","submitted_at":"2025-01-07T15:42:32Z","title":"CL3DOR: Contrastive Learning for 3D Large Multimodal Models via Odds Ratio on High-Resolution Point Clouds","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T21:48:27.009762Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2501.03879"},"observation_digest":"sha256:0c38eccdac63fdb3ec12b62d9818c7cc8925a303392bd7bb959565e6561f5d86","observation_id":"907e174d-fdc8-404d-b5db-bf8aa789b7cb","resolution":{"observed_at":"2026-08-10T21:48:27.009762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-16T14:35:06.515561Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-15T20:59:11.056801Z","title":"Chat-scene: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-18T08:45:23.685251Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.056801Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:f09e393b6f7808fc501b5150312df846a5d5b1f462b01d3ab47eaa43df02fdc0","observation_id":"b171e546-d8cd-4076-8a8f-7972e223fc3f","resolution":{"observed_at":"2026-08-15T20:59:11.056801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-16T14:35:06.515561Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-15T20:42:46.893381Z","title":"Chat-3d v2: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12253","last_updated":"2025-05-18T06:18:57Z","snapshot_observed_at":"2026-08-18T08:02:43.826301Z","submitted_at":"2025-05-18T06:18:57Z","title":"LLaVA-4D: Embedding SpatioTemporal Prompt into LMMs for 4D Scene Understanding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T20:42:46.893381Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2505.12253"},"observation_digest":"sha256:d667198c6a5b2039dc13a9b52e9d83d832fbb595b8c5041ac7274aaa95435779","observation_id":"bd07887c-f2d2-405e-b30e-2d9dce6fc3e9","resolution":{"observed_at":"2026-08-15T20:42:46.893381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-16T14:35:06.515561Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-07T13:46:17.141359Z","title":"Chat-3d v2: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-15T10:22:51.546118Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:17.141359Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:60423a04e200ca5ce99bfda7ff28cf4b88036aa279e13e8517919bd1fbb174f6","observation_id":"f1d2de7e-81d4-459f-9cda-97874fd4f2d5","resolution":{"observed_at":"2026-08-07T13:46:17.141359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-16T14:35:06.515561Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-07T12:16:11.043939Z","title":"Chat-scene: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:11.043939Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:9e7370136bd5454a4875ae2af577c4f9805e2b92946dd1e9e71401415eae2b64","observation_id":"83ed7cf1-98a9-455c-92d6-50f5faa34813","resolution":{"observed_at":"2026-08-07T12:16:11.043939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-16T14:35:06.515561Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-06T21:52:59.681855Z","title":"Chat-3d v2: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:59.681855Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:2a5e4c04f46d70ff9c636f41100ab96071ec59cc87badd0fea741388387efdc5","observation_id":"0f9edb34-9b72-4b97-8b5d-91ae6ec18f30","resolution":{"observed_at":"2026-08-06T21:52:59.681855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-16T14:35:06.515561Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-06T19:37:06.509669Z","title":"Huang, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-18T02:14:46.902275Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.509669Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:b61e5f9c30dcbede26fc5915e7ac26bc549c8cef7f0711c92a49e5c430789def","observation_id":"88a6554e-19af-47e0-8da7-d9bf491cdb57","resolution":{"observed_at":"2026-08-06T19:37:06.509669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-16T14:35:06.515561Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-06T18:03:00.188535Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-15T18:44:58.192236Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:00.188535Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:8531dfe81cf52040c18999fef9c04d83844a382192caf930a3de7dae154c9bc1","observation_id":"14f17569-c587-46af-bf64-25ab994e7398","resolution":{"observed_at":"2026-08-06T18:03:00.188535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-16T14:35:06.515561Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-06T16:45:18.210032Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-13T22:04:32.634745Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:18.210032Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:bc89833b17e26f19c652af3dd8b2bafcebfbacac4e23504b5bffb27eb164ad2f","observation_id":"fc0b60dd-6355-4a7b-af04-d789863647da","resolution":{"observed_at":"2026-08-06T16:45:18.210032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-16T14:35:06.515561Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-06T16:42:13.269825Z","title":"Chat-3d v2: Bridging 3d scene and large language models with object identifiers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12916","last_updated":"2025-07-17T09:02:04Z","snapshot_observed_at":"2026-08-17T09:54:48.802796Z","submitted_at":"2025-07-17T09:02:04Z","title":"Argus: Leveraging Multiview Images for Improved 3-D Scene Understanding With Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:42:13.269825Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2507.12916"},"observation_digest":"sha256:5cd691e6f24e6816f2be63dd8eadd2a8545c6b20b0fa4dbe730cfe2af0561397","observation_id":"d3b55d4d-7093-4d20-9716-1656db672a69","resolution":{"observed_at":"2026-08-06T16:42:13.269825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-16T14:35:06.515561Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-06T15:14:16.888231Z","title":"Chat-3d v2: Bridging 3d scene and large language models with object identifiers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16524","last_updated":"2025-07-22T12:32:35Z","snapshot_observed_at":"2026-08-18T10:31:05.809825Z","submitted_at":"2025-07-22T12:32:35Z","title":"Spatial 3D-LLM: Exploring Spatial Awareness in 3D Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:14:16.888231Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2507.16524"},"observation_digest":"sha256:072ef667828084e19f6a92f444c4b82149ae78c0e763b0b78cc90ef6db64a8fc","observation_id":"062f83a3-560f-41e2-8e9d-11384709116e","resolution":{"observed_at":"2026-08-06T15:14:16.888231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-16T14:35:06.515561Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":"2312.08168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-07-08T02:44:27.661049Z","title":"Chat-3d v2: Bridging 3d scene and large language models with object identifiers","venue":"cs.CV","work_id":"bf9609eb-e51e-44c0-a698-bd2be92b4a6c","year":2023},"citing_paper":{"arxiv_id":"2508.05269","last_updated":"2026-05-12T08:51:03Z","snapshot_observed_at":"2026-08-11T14:20:46.143755Z","submitted_at":"2025-08-07T11:11:56Z","title":"B4DL: A Benchmark for 4D LiDAR LLM in Spatio-Temporal Understanding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T00:09:57.236162Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2508.05269"},"observation_digest":"sha256:d3c7a856660705763017f92d75d991d4d828d0e27853f70223a0cbca36144d94","observation_id":"f61fc6d8-17f6-4dfd-9042-44b6db630081","resolution":{"observed_at":"2026-05-19T00:11:55.990699Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-16T14:35:06.515561Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":"2312.08168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-07-08T02:44:27.661049Z","title":"Chat-3d v2: Bridging 3d scene and large language models with object identifiers","venue":"cs.CV","work_id":"bf9609eb-e51e-44c0-a698-bd2be92b4a6c","year":2023},"citing_paper":{"arxiv_id":"2605.09218","last_updated":"2026-05-09T23:35:27Z","snapshot_observed_at":"2026-08-17T00:37:04.530223Z","submitted_at":"2026-05-09T23:35:27Z","title":"Flame3D: Zero-shot Compositional Reasoning of 3D Scenes with Agentic Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-12T02:09:09.684786Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2605.09218"},"observation_digest":"sha256:9b8da13a6b49fa4437f31d252ab453eab15d183f3ef4acacb6e2a6a8ea0e4254","observation_id":"364d4a58-010a-4834-b8f3-01f1140893dd","resolution":{"observed_at":"2026-05-12T02:11:15.851366Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-16T14:35:06.515561Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":"2312.08168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-07-08T02:44:27.661049Z","title":"Chat-3d v2: Bridging 3d scene and large language models with object identifiers","venue":"cs.CV","work_id":"bf9609eb-e51e-44c0-a698-bd2be92b4a6c","year":2023},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-07-16T23:18:47.677814Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-08T02:44:00.608590Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:84983141302c974040f2e958de05d56fe5514e57900d1949475be191288b153d","observation_id":"bc3c1cb1-049d-446a-9367-efe54c960990","resolution":{"observed_at":"2026-07-08T02:44:27.662561Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-16T14:35:06.515561Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Chat-3d v2: Bridging 3d scene and large language models with object identifiers.arXiv preprint arXiv:2312.08168, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-07-16T23:18:47.677814Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:488ca5e1abdae1ab5918ca6ac2ffa9e1c5ca0bd66b9f7efa03683b497769c8e5","observation_id":"6d645eff-9322-418b-bf88-1cc0453a0ee0","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-16T14:35:06.515561Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-02T00:23:01.530176Z","title":"Chat-3d v2: Bridging 3d scene and large language models with object identifiers.arXiv preprint arXiv:2312.08168,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-12T21:43:55.479737Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:01.530176Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:50ae82e294aaf6c9ce37a2f7fd0980dfcca1bead7a7bc05868eb5ebc5fc0bdf6","observation_id":"4675c47a-7b5a-4ab3-b24f-83a706477a0e","resolution":{"observed_at":"2026-08-02T00:23:01.530176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-16T14:35:06.515561Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-05T04:17:18.840883Z","title":"arXiv:2312.08168 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04009","last_updated":"2026-08-07T17:15:28Z","snapshot_observed_at":"2026-08-15T20:32:08.039648Z","submitted_at":"2026-08-04T17:59:56Z","title":"SocietyBench: Forecasting Counterfactual Social-World Evolution","version":1},"reference_index":147,"source":"arxiv_source","source_observed_at":"2026-08-05T04:17:18.840883Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2608.04009"},"observation_digest":"sha256:d3c6daddd192daee96bd719ebfa374bc72f31de7a8f82ec8530961fcdc52c204","observation_id":"f77f55a7-9fcd-4930-a28a-9d075308a302","resolution":{"observed_at":"2026-08-05T04:17:18.840883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-16T14:35:06.515561Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-10T04:29:41.225884Z","title":"arXiv:2312.08168 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04009","last_updated":"2026-08-07T17:15:28Z","snapshot_observed_at":"2026-08-15T20:32:08.039648Z","submitted_at":"2026-08-04T17:59:56Z","title":"SocietyBench: Forecasting Counterfactual Social-World Evolution","version":2},"reference_index":147,"source":"arxiv_source","source_observed_at":"2026-08-10T04:29:41.225884Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2608.04009"},"observation_digest":"sha256:5440c4e6693055f09cc562b19773a6034ee14ff5743704c1cd4cddc4d347f0b1","observation_id":"f4d0eec4-0369-41df-81bd-2fd1c884db49","resolution":{"observed_at":"2026-08-10T04:29:41.225884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-16T14:35:06.515561Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-06T04:28:22.542036Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05137","last_updated":"2026-08-10T14:28:23Z","snapshot_observed_at":"2026-08-14T22:57:36.738574Z","submitted_at":"2026-08-05T17:56:35Z","title":"SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T04:28:22.542036Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2608.05137"},"observation_digest":"sha256:b3fae27eca2ac50c33743334bb37700bc2242db5893fa8207ae016e5dbb234c0","observation_id":"166595a1-2bb6-4f83-8d6a-ed60a2d91047","resolution":{"observed_at":"2026-08-06T04:28:22.542036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-16T14:35:06.515561Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-10T04:30:40.863904Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05137","last_updated":"2026-08-10T14:28:23Z","snapshot_observed_at":"2026-08-14T22:57:36.738574Z","submitted_at":"2026-08-05T17:56:35Z","title":"SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T04:30:40.863904Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2608.05137"},"observation_digest":"sha256:0644fbc92705d3c3626ea1b0f78a38a52f2301dc9e430f010e3399ae1c5b888f","observation_id":"5c4ff52c-5c96-4b82-8145-5347e70b6aad","resolution":{"observed_at":"2026-08-10T04:30:40.863904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-16T14:35:06.515561Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-11T04:18:06.857543Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05137","last_updated":"2026-08-10T14:28:23Z","snapshot_observed_at":"2026-08-14T22:57:36.738574Z","submitted_at":"2026-08-05T17:56:35Z","title":"SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:06.857543Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2608.05137"},"observation_digest":"sha256:30e05f990473391ccac4d5423cb7ee7a638b1d093c76185a9bc11c171672e622","observation_id":"b2bc0ca0-a3d6-4508-b248-06b766cd70ca","resolution":{"observed_at":"2026-08-11T04:18:06.857543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-16T14:35:06.515561Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-12T15:33:29.215429Z","title":"Chat-scene: Bridging 3d scene and large language models with object identifiers.arXiv preprint arXiv:2312.08168, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-16T14:27:26.828874Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.215429Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:fff6b26afe23d27f0c7fc5f31057766c31b88b9db4bd7013972b0c355f79c008","observation_id":"80814b0b-2ab0-46c3-a529-d5a44720240d","resolution":{"observed_at":"2026-08-12T15:33:29.215429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2312.08168/citation-record","integrity":"/paper/2312.08168/integrity","json":"/paper/2312.08168/citation-record.json","paper":"/paper/2312.08168"},"outbound":[],"paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T14:35:06.515561Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 28 inbound Pith citation observations for arXiv:2312.08168."}