{"as_of":"2026-08-17T20:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e05549637e35b9288036f444d95e06cc6af9b0a116c5a60ffcbffa2c7c7a6f5a","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T04:35:37.029873Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:22:03.376214Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T10:49:47.240788Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01292","snapshot_observed_at":"2026-08-15T23:22:03.376214Z","title":"Lscenellm: Enhancing large 3d scene understand- ing using adaptive visual preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T11:36:04.921578Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.376214Z"},"links":{"cited_paper":"/paper/2412.01292","citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:b3faddd11a5d54f3a2f4f6947ac51c2e5c371f2089df4e4b08ea0317058686d6","observation_id":"7e8b58bb-e232-48c0-9cc4-1cc51e9b19ae","resolution":{"observed_at":"2026-08-15T23:22:03.376214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01292","snapshot_observed_at":"2026-08-15T20:42:46.765433Z","title":"Lscenellm: Enhancing large 3d scene understanding using adaptive visual preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12253","last_updated":"2025-05-18T06:18:57Z","snapshot_observed_at":"2026-08-16T22:53:11.359097Z","submitted_at":"2025-05-18T06:18:57Z","title":"LLaVA-4D: Embedding SpatioTemporal Prompt into LMMs for 4D Scene Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:42:46.765433Z"},"links":{"cited_paper":"/paper/2412.01292","citing_paper":"/paper/2505.12253"},"observation_digest":"sha256:f3845daa3589baf4cebd53f32c93cb694b01b7902e9a1ef4f95d67136c84fdb9","observation_id":"9faf74b7-9151-42b8-a42e-61024e8edca4","resolution":{"observed_at":"2026-08-15T20:42:46.765433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01292","snapshot_observed_at":"2026-08-07T11:01:49.176786Z","title":"Lscenellm: Enhancing large 3d scene understanding using adaptive visual preferences,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03583","last_updated":"2025-06-04T05:26:51Z","snapshot_observed_at":"2026-08-17T00:12:09.291114Z","submitted_at":"2025-06-04T05:26:51Z","title":"A Large-Scale Referring Remote Sensing Image Segmentation Dataset and Benchmark","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:01:49.176786Z"},"links":{"cited_paper":"/paper/2412.01292","citing_paper":"/paper/2506.03583"},"observation_digest":"sha256:e84e715e771209cc56b349de0e51610aa13ad789cf23ddc802cab3fcce2f05bf","observation_id":"91e291e6-f4df-43a5-88c0-2cb0ff3dd88f","resolution":{"observed_at":"2026-08-07T11:01:49.176786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01292","snapshot_observed_at":"2026-08-07T10:25:48.086502Z","title":"Lscenellm: Enhancing large 3d scene understanding using adaptive visual preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-16T14:13:17.677398Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:48.086502Z"},"links":{"cited_paper":"/paper/2412.01292","citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:ef5000fdc299044a04065a21040559a812872c6c6ea9058a87abcfc8fc09a532","observation_id":"537570de-39ae-44c7-b1c1-77720a093e87","resolution":{"observed_at":"2026-08-07T10:25:48.086502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01292","snapshot_observed_at":"2026-08-06T21:11:41.554989Z","title":"Lscenellm: Enhancing large 3d scene understanding using adaptive visual preferences.arXiv:2412.01292, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.554989Z"},"links":{"cited_paper":"/paper/2412.01292","citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:d56731673b33200908d174b65239847c1275ed05624fbd22c9bde7782a8f80c8","observation_id":"5587a349-bc45-4921-9800-e501f3c2a3f7","resolution":{"observed_at":"2026-08-06T21:11:41.554989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"cited_work":{"arxiv_id":"2412.01292","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.01292","snapshot_observed_at":"2026-08-06T10:49:47.240788Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","venue":"cs.CV","work_id":"9e505f9c-4618-487d-9793-52a7c04bdbbc","year":2024},"citing_paper":{"arxiv_id":"2507.23478","last_updated":"2025-07-31T11:59:06Z","snapshot_observed_at":"2026-08-14T04:49:13.419227Z","submitted_at":"2025-07-31T11:59:06Z","title":"3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-06T10:49:47.135209Z"},"links":{"cited_paper":"/paper/2412.01292","citing_paper":"/paper/2507.23478"},"observation_digest":"sha256:bb0ed2835ac54ae72c2b3317a043284fa839ad1667353a70941c6c4f9228ed53","observation_id":"966be097-444d-475d-91d4-6aabacd26c1e","resolution":{"observed_at":"2026-08-06T10:49:47.249706Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01292","snapshot_observed_at":"2026-08-04T17:31:43.089996Z","title":"Lscenellm: Enhancing large 3d scene understanding using adaptive visual preferences,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-17T09:53:45.854747Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:43.089996Z"},"links":{"cited_paper":"/paper/2412.01292","citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:b8f31bd668b78a86c2c54abcc952f93f2c36a0bd4de92fd32c2456aa0801129c","observation_id":"c02b4ead-fde1-4b93-92b0-417ce4d8e435","resolution":{"observed_at":"2026-08-04T17:31:43.089996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.01292/citation-record","integrity":"/paper/2412.01292/integrity","json":"/paper/2412.01292/citation-record.json","paper":"/paper/2412.01292"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:38.065183Z","title":"Referit3d: Neural listeners for fine-grained 3d object identification in real-world scenes","venue":null,"work_id":"06eb21cb-d025-46dd-a2d8-9c3b047139c3","year":2020},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.758229Z"},"links":{"citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:642c0675216be48a6908a139f92e1c61309f59ad3f2bcd14342f3eecfa7a438e","observation_id":"3fe63a2a-e12e-4997-9012-8109844ba71e","resolution":{"observed_at":"2026-08-12T04:35:38.070144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:38.047904Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":"34697cf7-94d9-403b-993a-533c010c98ee","year":2022},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.764332Z"},"links":{"citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:5c978720c138c5276857c38598636d236ab266df0dc705bd7b48aeea00d65aca","observation_id":"cce39ea2-b811-48b5-afb0-58f06112dc11","resolution":{"observed_at":"2026-08-12T04:35:38.053855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-12T04:35:36.770448Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.770448Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:f4be473c340768d7d151ec68d2afd4b75bea1e590e2c5d5664bbf70439fc4eb0","observation_id":"89625eb6-3a0a-47af-b56b-0c07ee467f36","resolution":{"observed_at":"2026-08-12T04:35:36.770448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:38.029127Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with hu- man judgments","venue":null,"work_id":"a20cb0cf-4e89-4b4b-b8ce-46eb42d8854c","year":2005},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.775993Z"},"links":{"citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:e11c117cc17db83388180291949375e11f2c7bbb2a9722ae3842b1d4a63f8ab0","observation_id":"0f011e68-62db-40b9-9a65-35802a41da18","resolution":{"observed_at":"2026-08-12T04:35:38.034213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.08897","last_updated":"2022-01-12T08:19:29Z","snapshot_observed_at":"2026-07-06T12:09:19.763667Z","submitted_at":"2021-11-17T04:27:01Z","title":"ARKitScenes: A Diverse Real-World Dataset For 3D Indoor Scene Understanding Using Mobile RGB-D Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.08897","snapshot_observed_at":"2026-08-12T04:35:36.781754Z","title":"Arkitscenes: A diverse real-world dataset for 3d indoor scene understanding using mobile rgb-d data","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.781754Z"},"links":{"cited_paper":"/paper/2111.08897","citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:57e87680478dbf81d9cc15b69283613b3f86334609e3b969e3f49a95037cb17d","observation_id":"8314fb60-969c-494a-8404-e6af4f4ace65","resolution":{"observed_at":"2026-08-12T04:35:36.781754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:36.787399Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.787399Z"},"links":{"citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:15d629506e81f511590076322fff620d7d3bd5975dd604f77d58cd276fc0680b","observation_id":"766b527c-8945-45cc-85b4-3158c4abfe4d","resolution":{"observed_at":"2026-08-12T04:35:36.787399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07997","last_updated":"2023-08-15T19:01:19Z","snapshot_observed_at":"2026-08-16T15:08:16.170695Z","submitted_at":"2023-08-15T19:01:19Z","title":"$A^2$Nav: Action-Aware Zero-Shot Robot Navigation by Exploiting Vision-and-Language Ability of Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07997","snapshot_observed_at":"2026-08-12T04:35:36.793861Z","title":"A2nav: Action-aware zero-shot robot navigation by exploit- ing vision-and-language ability of foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.793861Z"},"links":{"cited_paper":"/paper/2308.07997","citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:89f76b2b9cb0bc39b34facd6d201f6302e6a816f306319fc16e71315738d4be7","observation_id":"99481ef7-81e6-43aa-8a80-6e604f803d84","resolution":{"observed_at":"2026-08-12T04:35:36.793861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:38.001676Z","title":"Ll3da: Visual interactive instruction tuning for omni-3d understand- ing reasoning and planning","venue":null,"work_id":"a1a8b179-47ad-410c-84a6-aee3fd90a82b","year":2024},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.799342Z"},"links":{"citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:f7a53385aa927d23c9285861a88147ddb2d3dda81cd21cbd688ae2d000c59ba0","observation_id":"0ed7d7af-6a74-46ef-a9c0-42411919e95f","resolution":{"observed_at":"2026-08-12T04:35:38.007324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:37.981876Z","title":"End-to-end 3d dense captioning with vote2cap- detr","venue":null,"work_id":"2ea46e87-1ebe-47eb-8036-1d0419dd8a6c","year":2023},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.805160Z"},"links":{"citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:123522a0ad1d9892479f8dcce2f17248766423b2337768be077c26bdf31cf2a8","observation_id":"55b59e00-9332-4f1b-85b8-fea3868d9847","resolution":{"observed_at":"2026-08-12T04:35:37.988183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:36.810807Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.810807Z"},"links":{"citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:5c534a952554b897619660bd42b2962b2c5cc98ed2eadfc7b57a910ab0024c60","observation_id":"0084ae39-f534-471a-b858-6b40fbd4d9d1","resolution":{"observed_at":"2026-08-12T04:35:36.810807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:36.816633Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.816633Z"},"links":{"citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:917efefb7d1ed00e97217ed0d6ba4b616574ff3815c52dac8fd1d45c8444f4f6","observation_id":"95bbf4d7-0bfb-4bee-9130-8cbbc9b3daf7","resolution":{"observed_at":"2026-08-12T04:35:36.816633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11401","last_updated":"2024-03-22T18:52:51Z","snapshot_observed_at":"2026-08-17T15:42:36.096154Z","submitted_at":"2024-03-18T01:18:48Z","title":"Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11401","snapshot_observed_at":"2026-08-12T04:35:36.823134Z","title":"Scene-llm: Extending language model for 3d visual understanding and reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.823134Z"},"links":{"cited_paper":"/paper/2403.11401","citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:d8011d386f8d9db780bf8c918cbd6149be1c33cea7d603320d06e23d2f1a2816","observation_id":"b7b8680e-eed0-4471-94fc-ec625400368c","resolution":{"observed_at":"2026-08-12T04:35:36.823134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-08-12T23:40:42.885633Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-12T04:35:36.830027Z","title":"Llama-adapter v2: Parameter-efficient visual instruction model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.830027Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:248e0fddf53e38c3a5c1520eb364a6be0882705f632e8cd2dcc05d1817453fc8","observation_id":"831ae781-da79-4ceb-86bc-b97f7354b054","resolution":{"observed_at":"2026-08-12T04:35:36.830027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-16T15:03:56.512242Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-12T04:35:36.836304Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understand- ing, generation, and instruction following","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.836304Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:68ea1da05f9041e8ba4991f33a2bb97a94545ee02aa87886a01528a66952d8c8","observation_id":"a4448104-fa27-41da-bf9f-d48299e08c4d","resolution":{"observed_at":"2026-08-12T04:35:36.836304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:36.844087Z","title":"3d-llm: Injecting the 3d world into large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.844087Z"},"links":{"citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:f7088ae6d457de2f1b400237fbb0eb2af3d1a85221226c98a4e165793345ec33","observation_id":"9598c877-e40e-4dca-a05f-1c8b005f0efc","resolution":{"observed_at":"2026-08-12T04:35:36.844087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:37.927477Z","title":"Chat-scene: Bridging 3d scene and large language models with object identifiers, 2024","venue":null,"work_id":"f0af084a-838d-406b-ac49-ff294993372d","year":2024},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.852883Z"},"links":{"citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:4cc8e74ff9573eca196a49376a3fc75311ffedbe2496ebdb3b863eb7dcb22790","observation_id":"1a5b9862-ebd9-4560-9457-c18768df34dd","resolution":{"observed_at":"2026-08-12T04:35:37.933127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-16T14:35:06.515561Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-12T04:35:36.858454Z","title":"Chat-3d v2: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.858454Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:9aeb88274ac6d7f45c2dc4b031a6db436f189b53ba49e596990eeb535792b5dd","observation_id":"27f7e11d-5cba-4ba7-9b8b-aa69f5a921d3","resolution":{"observed_at":"2026-08-12T04:35:36.858454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12871","last_updated":"2024-05-09T17:35:44Z","snapshot_observed_at":"2026-08-05T10:01:43.401012Z","submitted_at":"2023-11-18T01:21:38Z","title":"An Embodied Generalist Agent in 3D World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12871","snapshot_observed_at":"2026-08-12T04:35:36.865168Z","title":"An embodied generalist agent in 3d world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.865168Z"},"links":{"cited_paper":"/paper/2311.12871","citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:f2a57620766028c1bc53c600d896e732ed82a81a83c9d86575ce11ae24831520","observation_id":"b8e95ab9-4675-4a26-8643-a5b8ab002919","resolution":{"observed_at":"2026-08-12T04:35:36.865168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05973","last_updated":"2023-11-02T06:53:37Z","snapshot_observed_at":"2026-08-05T01:03:23.456778Z","submitted_at":"2023-07-12T07:40:48Z","title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05973","snapshot_observed_at":"2026-08-12T04:35:36.871188Z","title":"V oxposer: Composable 3d value maps for robotic manipulation with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.871188Z"},"links":{"cited_paper":"/paper/2307.05973","citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:65f81d2737cb175ce4d74f6ad33aa5d88c93f52771dc6a3816cc932036be2989","observation_id":"dc713f0b-4911-4c64-bd7e-847baf796a85","resolution":{"observed_at":"2026-08-12T04:35:36.871188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09340","last_updated":"2024-09-24T03:18:24Z","snapshot_observed_at":"2026-08-16T14:26:43.973134Z","submitted_at":"2024-01-17T17:04:35Z","title":"SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09340","snapshot_observed_at":"2026-08-12T04:35:36.876736Z","title":"Sceneverse: Scaling 3d vision-language learning for grounded scene un- derstanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.876736Z"},"links":{"cited_paper":"/paper/2401.09340","citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:a7691d368a96d0252eb17e7aad1d56a701990860cd68f13f71e1f972094ced5f","observation_id":"16476d8f-cf5d-460d-8cbd-6c8c3c118703","resolution":{"observed_at":"2026-08-12T04:35:36.876736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:37.910674Z","title":"Context-aware alignment and mutual masking for 3d-language pre-training","venue":null,"work_id":"16867052-7e08-4e0e-90c7-afe5dfebd670","year":2023},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.882736Z"},"links":{"citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:3ef3a1baef78bbbf5a404c0f69fed4e6477df1733cd50d27e992baed34152975","observation_id":"ac1239c6-4c5f-47d1-a80f-5c66a1dc739c","resolution":{"observed_at":"2026-08-12T04:35:37.916311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:37.892408Z","title":"Beyond the nav-graph: Vision-and-language navigation in continuous environments","venue":null,"work_id":"d771d0e5-03d1-41b5-b800-faefd09bfd0c","year":2020},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.887832Z"},"links":{"citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:16b64f968f44e61578054e8a89f386d781673898d979e6be276f771dcd7c841f","observation_id":"91ac9420-3e8a-4900-b510-e51b59bc384a","resolution":{"observed_at":"2026-08-12T04:35:37.897796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:36.894102Z","title":"Blip- 2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.894102Z"},"links":{"citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:94ddbc12688b8017f4416ed9b1bffd82f8ec356db4a48ab4c12109395576c018","observation_id":"f90ef089-cb8b-405a-a583-f9d18e022e63","resolution":{"observed_at":"2026-08-12T04:35:36.894102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:36.900360Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.900360Z"},"links":{"citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:dcd9cb86c749d7f8ab24a46db01e88c8612019cedfacbfaf79fbab0a11e93f56","observation_id":"28576c4a-b2b0-42e9-9c68-fe7aef66df65","resolution":{"observed_at":"2026-08-12T04:35:36.900360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:36.905491Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.905491Z"},"links":{"citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:ff42e1be404428898dbd60e3c44bf8a208366ae9288c47f2ae55cf5a7798daa2","observation_id":"e4249674-4ce6-4727-a50f-667fa6c79017","resolution":{"observed_at":"2026-08-12T04:35:36.905491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-12T04:35:36.911294Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.911294Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:a28dd5a9ab2ff62ed2b85d036c2058fba97905e88f6390d7890923bf7ce77465","observation_id":"7b1d5d94-7ef6-46d9-b3b1-145ecc5d3287","resolution":{"observed_at":"2026-08-12T04:35:36.911294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:37.822536Z","title":"Openscene: 3d scene understanding with open vocabularies","venue":null,"work_id":"7c621990-62ac-414c-81fd-19eb3c45690c","year":2023},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.916675Z"},"links":{"citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:ffca58a4dd60c4bbb80820a8b2cecc614829c9d1b3cf7010c73c4bccdd292c9b","observation_id":"03f47964-be3c-47ca-a0ed-e811e786e0ab","resolution":{"observed_at":"2026-08-12T04:35:37.828298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:36.921651Z","title":"Pointnet++: Deep hierarchical feature learning on point sets in a metric space","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.921651Z"},"links":{"citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:6990f1b1bdfb568d9be1167e38db89d2f2f2b5703197c20623fa4e4636d85d04","observation_id":"aa0ba61a-c73e-45dd-8cca-f1cafe004031","resolution":{"observed_at":"2026-08-12T04:35:36.921651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:36.926180Z","title":"Nuscenes-qa: A multi-modal visual question answering benchmark for autonomous driving scenario","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.926180Z"},"links":{"citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:2fbdb5ec479afd6f0f50737d2a849a852181355624af023f6de2e13e2007d7e4","observation_id":"2cf8fe14-0928-4d78-bda2-90b5bf9784aa","resolution":{"observed_at":"2026-08-12T04:35:36.926180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08238","last_updated":"2021-09-16T22:01:24Z","snapshot_observed_at":"2026-08-15T09:50:41.483833Z","submitted_at":"2021-09-16T22:01:24Z","title":"Habitat-Matterport 3D Dataset (HM3D): 1000 Large-scale 3D Environments for Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08238","snapshot_observed_at":"2026-08-12T04:35:36.931272Z","title":"Habitat-matterport 3d dataset (hm3d): 1000 large-scale 3d environments for embodied ai","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.931272Z"},"links":{"cited_paper":"/paper/2109.08238","citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:448648e436bcf9d581ab3a314d6bd9f8983653fd26a90bdd418340538ef5b4a8","observation_id":"d32fbdfe-714f-49aa-8c0e-604f83201fc7","resolution":{"observed_at":"2026-08-12T04:35:36.931272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:37.772305Z","title":"Eye movements in iconic visual search","venue":null,"work_id":"a8fee2b0-512d-42c2-b616-6db7382b0d3c","year":2002},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.937120Z"},"links":{"citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:0a752005e562f4bf5494c10a869fc1001243e128f95f7a5219f96c80c3bd9365","observation_id":"0b67ca78-061a-4d9c-bb91-f968e9452ec5","resolution":{"observed_at":"2026-08-12T04:35:37.781151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:36.942835Z","title":"Mask3d: Mask transformer for 3d semantic instance segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.942835Z"},"links":{"citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:4a4e4ddba6cc9c1b1ed7dbd042b0594e96e1fdb94afa99e6343816a54cdf13b0","observation_id":"4a93a63b-c80b-4b5e-9944-eeee7bd933a5","resolution":{"observed_at":"2026-08-12T04:35:36.942835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:37.735360Z","title":"Indoor scene segmen- tation using a structured light sensor","venue":null,"work_id":"fe16439c-efa0-41ef-9d88-6138ef1f52a8","year":2011},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.947620Z"},"links":{"citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:7a42e8de7c2309a2ce66838188a82b0e6e51d990b946fd5e05d42a6c2296bcdd","observation_id":"49ba5686-d19b-4bfd-9813-167bdebcc65a","resolution":{"observed_at":"2026-08-12T04:35:37.743530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:36.953258Z","title":"Sun rgb-d: A rgb-d scene understanding benchmark suite","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.953258Z"},"links":{"citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:f0812b746007ddba53b8d0c605f74af29ae30cbfd87f1f34568ac65ea82effe0","observation_id":"5eec47bb-6fef-436a-9893-525d27d01bd3","resolution":{"observed_at":"2026-08-12T04:35:36.953258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:37.697879Z","title":"Fgprompt: fine-grained goal prompting for image-goal navigation","venue":null,"work_id":"31803ce4-708a-47a3-a880-05fe09fa4973","year":2024},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.958878Z"},"links":{"citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:fef1b265acb073abbc8c8af14fb7de923bf7f26ee19009838a39d3c3970b5251","observation_id":"e3ae5547-944b-4072-b5ab-31fefc9fe72a","resolution":{"observed_at":"2026-08-12T04:35:37.704457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01413","last_updated":"2024-05-02T16:04:30Z","snapshot_observed_at":"2026-08-16T13:55:54.832927Z","submitted_at":"2024-05-02T16:04:30Z","title":"MiniGPT-3D: Efficiently Aligning 3D Point Clouds with Large Language Models using 2D Priors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01413","snapshot_observed_at":"2026-08-12T04:35:36.964112Z","title":"Minigpt-3d: Efficiently aligning 3d point clouds with large language models using 2d priors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.964112Z"},"links":{"cited_paper":"/paper/2405.01413","citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:0e9c6faf5944147e524ee14bbcfe1df6b9c2e620f49042922454d6316f172ee7","observation_id":"2abc01b9-451d-48fa-9b09-c1b2d4935959","resolution":{"observed_at":"2026-08-12T04:35:36.964112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T04:35:36.969395Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.969395Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:456a7eb1748077e4a32291d714fca4cac165ca2aa6c81dcf1000ba7321c09f7b","observation_id":"d38280e9-3764-4b09-9095-8f114c10ff3e","resolution":{"observed_at":"2026-08-12T04:35:36.969395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:37.678491Z","title":"A feature-integration theory of attention","venue":null,"work_id":"d90f0459-318e-4e29-bef0-d94441831278","year":1980},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.974290Z"},"links":{"citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:987fdd08a0bf066adbf775cebf01d3e1909b5200067d5f4b39695efac7dc4227","observation_id":"0fd286fb-d35a-4bb2-86ca-7f27d0c4447f","resolution":{"observed_at":"2026-08-12T04:35:37.684125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:37.661062Z","title":"Cider: Consensus-based image description evalu- ation","venue":null,"work_id":"24ce04cb-05b7-4974-88d4-f7dce9958892","year":2015},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.979864Z"},"links":{"citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:d79cce10416c622c891784f5ad668c3d3e40eea7b9bab25d5d6b0278f8d34325","observation_id":"44949439-52ab-4c0d-89a1-1e7d694004e8","resolution":{"observed_at":"2026-08-12T04:35:37.666338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:37.641848Z","title":"Rio: 3d object instance re-localization in changing indoor environments","venue":null,"work_id":"7dc5a8c1-ef18-4408-b1de-3b8906f6ed43","year":2019},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.985024Z"},"links":{"citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:f22fcaf43019b7e387dcc897ca26d61d826b13a5c7d91825ce788d9cb2c41bc9","observation_id":"6070df36-5bfd-4529-b8ac-c1d978427a70","resolution":{"observed_at":"2026-08-12T04:35:37.649299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08769","last_updated":"2023-08-17T03:52:15Z","snapshot_observed_at":"2026-08-16T15:07:56.298993Z","submitted_at":"2023-08-17T03:52:15Z","title":"Chat-3D: Data-efficiently Tuning Large Language Model for Universal Dialogue of 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08769","snapshot_observed_at":"2026-08-12T04:35:36.991429Z","title":"Chat-3d: Data-efficiently tuning large language model for universal dialogue of 3d scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.991429Z"},"links":{"cited_paper":"/paper/2308.08769","citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:699f424a9ea6dcf3db4f78c5e313a5e3f0e39413ec3216d8de097c3c9ce67a67","observation_id":"470c7e11-cbf2-4bdb-b133-de04097cc0c4","resolution":{"observed_at":"2026-08-12T04:35:36.991429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03272","last_updated":"2024-09-05T06:30:01Z","snapshot_observed_at":"2026-08-16T13:21:11.315633Z","submitted_at":"2024-09-05T06:30:01Z","title":"OccLLaMA: An Occupancy-Language-Action Generative World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03272","snapshot_observed_at":"2026-08-12T04:35:36.997620Z","title":"Occllama: An occupancy-language-action generative world model for au- tonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.997620Z"},"links":{"cited_paper":"/paper/2409.03272","citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:40d9afb1032c8cb73de77d0be75f92c0ce280d8f0923c9ee7ee1290ac62b41ae","observation_id":"4a82ddc5-e9f0-4d88-8fdc-c8425cae31b4","resolution":{"observed_at":"2026-08-12T04:35:36.997620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:37.621691Z","title":"What attributes guide the deployment of visual attention and how do they do it? Nature reviews neuroscience, 5(6):495–501, 2004","venue":null,"work_id":"8e962ebc-6fc0-42ca-9ad2-0090d85adc82","year":2004},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:37.004468Z"},"links":{"citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:b89ffd1c4d56e5b86039e7b3cfdc70644bd3d6cefcd541a41d126fc92a01455a","observation_id":"bb40708d-d3b5-4e09-aa2b-cb2dba6761f4","resolution":{"observed_at":"2026-08-12T04:35:37.629469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16911","last_updated":"2024-09-06T22:45:43Z","snapshot_observed_at":"2026-08-16T15:04:12.996129Z","submitted_at":"2023-08-31T17:59:46Z","title":"PointLLM: Empowering Large Language Models to Understand Point Clouds","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16911","snapshot_observed_at":"2026-08-12T04:35:37.009769Z","title":"Pointllm: Empowering large language models to understand point clouds","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:37.009769Z"},"links":{"cited_paper":"/paper/2308.16911","citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:c8cb87280e19fb175e2add5cc4007f6b35f799c6ca022a31cf08abc25c76ff38","observation_id":"6e6ffa06-16de-4985-b0fd-5779beaf94e6","resolution":{"observed_at":"2026-08-12T04:35:37.009769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14074","last_updated":"2023-12-21T17:52:12Z","snapshot_observed_at":"2026-08-16T14:32:29.697633Z","submitted_at":"2023-12-21T17:52:12Z","title":"LiDAR-LLM: Exploring the Potential of Large Language Models for 3D LiDAR Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14074","snapshot_observed_at":"2026-08-12T04:35:37.014890Z","title":"Lidar-llm: Exploring the potential of large language models for 3d lidar understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:37.014890Z"},"links":{"cited_paper":"/paper/2312.14074","citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:4a6756acf7d22ffe66754e0c29a306bbe84afb0b15fc5f385f1d396e34e7352d","observation_id":"8aca1262-4a18-4809-adfd-c15946878935","resolution":{"observed_at":"2026-08-12T04:35:37.014890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-12T04:35:37.020259Z","title":"Deco: Decoupling token compres- sion from semantic abstraction in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:37.020259Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:5469a74ad3250764b3bb0e58b3ce70d0a20a061f57ba41063dcfac6e4e6ecf22","observation_id":"6ba662bc-0477-4522-9029-b31ae0f3edb1","resolution":{"observed_at":"2026-08-12T04:35:37.020259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:37.598970Z","title":"Uni3d: A unified baseline for multi-dataset 3d object detection","venue":null,"work_id":"97af6417-5b04-4a5c-8004-a6949107db86","year":2023},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:37.025291Z"},"links":{"citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:dfcabacce99f41060b78884c5d6078da7152f1d5ce9b62ee421693f6a2d68deb","observation_id":"11dde869-e4c9-4999-a23d-7b200624bf83","resolution":{"observed_at":"2026-08-12T04:35:37.606717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-13T15:09:51.205767Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-12T04:35:37.029873Z","title":"3d-vla: A 3d vision-language-action generative world model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:37.029873Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:186ad33a193d19bb02b308e036658f884ce849a2fdd78ecdab8f66806c95ad83","observation_id":"83f99ab1-5a8a-4afa-a952-dbb517c0ee36","resolution":{"observed_at":"2026-08-12T04:35:37.029873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 7 inbound Pith citation observations for arXiv:2412.01292."}