{"as_of":"2026-08-13T16:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:83ab49d85ae6fe9ee021c110aecf98d91d2af7ebe337f42e424fb7f4739d2b5a","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T07:00:06.887909Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.05493/citation-record","integrity":"/paper/2607.05493/integrity","json":"/paper/2607.05493/citation-record.json","paper":"/paper/2607.05493"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Referit3D: Neural listeners for fine-grained 3D object identification in real-world scenes","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:19c2591a790f5c4b4834576cb3dd495f729086a463c420093d73ad8ea7c4d9f8","observation_id":"7fbfe4f1-87ff-4aa8-8c15-5e1d3f471fb9","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Kestrel: 3D multimodal llm for part-aware grounded description","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:748a9e66fabe38c0cf1a5cc75bae18b55b0f3ec7ee61973b89b9d9148d3c793d","observation_id":"aeaa3a1f-3ccd-4e7d-94ec-798e8059b9da","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Scanqa: 3D question answering for spatial scene understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:af7e171410241ea4cc18bfdae078f8f85754b4d75fc0e4d2bbfe3d8c4e06e9f0","observation_id":"6ff0dec0-4444-4f76-b510-2d7a63ad383a","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:d2e84400636de8910e9228d01869ff85b0f24b844f9563e12e4650bf0415338e","observation_id":"34211933-6998-4e76-a3bd-26e464b8d146","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"OPEN-YOLO 3D: Towards fast and accurate open-vocabulary 3D instance segmentation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:92cc55a3e6b2b7890a705b6755e8554fce21b57813e52eba83d7e48677a64c7b","observation_id":"c7f4a444-f0c1-4339-bc21-687174d5f48b","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:e2bee49cd8396042438ef92848482c140fe575b1d1bf7ae79c3285c65acce27e","observation_id":"914028de-8979-4a28-b8fb-a6d0b3cc3d7f","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Scanrefer: 3D object localization in rgb-d scans using natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:224d1472a563fb47869fb751ac85443eda43fdec676ed7c85ab888ae4231b683","observation_id":"8e053c2d-1e81-4acb-9c22-26d7145cab6f","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"SD-VLM: Spatial measuring and understanding with depth-encoded vision-language models.arXiv preprint arXiv:2509.17664, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:cc78112f10f7ce04180fc726c9604805a690987a29e72fe421a43a24f21f80c5","observation_id":"a6a11c7d-6ac9-447d-9978-fc376cba04b5","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"SpatialRGPT: Grounded spatial reasoning in vision-language models.Advances in Neural Information Processing Systems, 37:135062–135093, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:33a08761d831f2cb54d4ec0e6d2a75dfd674bcf79e7837c62f19ee255fac2bfa","observation_id":"38952829-d990-4a0a-9986-0d2c01dd6aed","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"4D spatio-temporal convnets: Minkowski con- volutional neural networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:d13c3a617b2f5fad39d54695e3e746958eee940662cc8bcf5f2b90c2d49a3f84","observation_id":"2e67eb86-6367-47a2-b529-8eb5951d43ec","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Spconv: Spatially sparse convolution library","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:f5365e78527e2167a5b112bcadfd82f0148264d3afdaed8e2c4438b9cfbd1239","observation_id":"8c073c39-2917-48b2-93cc-e3e4fabb1f38","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Scannet: Richly-annotated 3D reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:657bfce53de6abc0bea7b733e5ca5e761d6c9c26367834f296e29eb94b5be00a","observation_id":"3e4fa938-8774-4d12-8ee8-3d1a06e055da","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"MM-Spatial: Exploring 3D spatial understanding in multimodal LLMs, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:d73317e607727dc0d59bcf9fd8c00e99dba08cce6f7d181f991581663d334e45","observation_id":"e9acc02d-1a39-4c47-8ecc-a457ecd8206c","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Segpoint: Segment any point cloud via large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:3f97da95d083cf28abb6a30df0970b0747f1b9d0181a6ab4c0f0bd3288839bba","observation_id":"98b77c19-369c-4b00-b1b4-bef3da8a232a","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"LoRA: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:ab6aa63111c4f2b0b8b2b84624141c455eddf32bd10a2db209120698862bf303","observation_id":"976c6dc2-04d9-456c-9766-ec30e1edb0bc","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"MLLM-For3D: Adapting multimodal large language model for 3D reasoning segmentation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:9ad73805d848d22c8287ed002bd76b94d506f02f3f4ccc01ac79369f31e1f19f","observation_id":"2d057c75-08b0-4d00-ad4f-1f5d805b3197","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17427","last_updated":"2025-02-09T07:32:21Z","snapshot_observed_at":"2026-08-12T23:56:51.147949Z","submitted_at":"2024-05-27T17:59:41Z","title":"Reason3D: Searching and Reasoning 3D Segmentation via Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17427","snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Reason3D: Searching and reasoning 3D segmentation via large language model.arXiv preprint arXiv:2405.17427, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"cited_paper":"/paper/2405.17427","citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:4b82c4f1371e4b0b8799f4b4e7bf7e8a382cb41d49a39b2457ff35dc9af6a771","observation_id":"08dc9d04-6e6d-420a-917d-7d861e367414","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Text-guided graph neural networks for referring 3D instance segmentation.AAAI, 35(2):1610–1618, May 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:c2b8ce517415becca2cb8b4edebf0a628e7accbd175db8b82d2695ed31aedb3f","observation_id":"2a9e9ebc-7251-4165-a5d4-ba9a5895d877","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Openclip","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:747385b9dcea285899086127eab5f506ba2313fe4d1100a7a114eb750b6efe36","observation_id":"121cd119-b855-4d3e-bb9e-b68161e39acd","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08879","last_updated":"2022-07-21T05:25:39Z","snapshot_observed_at":"2026-08-13T03:45:52.907168Z","submitted_at":"2021-12-16T13:50:23Z","title":"Bottom Up Top Down Detection Transformers for Language Grounding in Images and Point Clouds","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08879","snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Bottom up top down detection transformers for language grounding in images and point clouds","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"cited_paper":"/paper/2112.08879","citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:89fe3ca6f93fb94e3f760abf28d58908969021a8109538e32715abc52d3d92fa","observation_id":"4bfbc7c2-6861-42b0-bfcd-6a24fc56eae7","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18295","last_updated":"2025-02-17T23:10:49Z","snapshot_observed_at":"2026-08-12T23:56:02.683902Z","submitted_at":"2024-05-28T15:48:39Z","title":"Intent3D: 3D Object Detection in RGB-D Scans Based on Human Intention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18295","snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Intent3D: 3D object detection in rgb-d scans based on human intention.arXiv preprint arXiv:2405.18295, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"cited_paper":"/paper/2405.18295","citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:c971503937c277cb7ed62bbcba74b50e9bc6616dee51174f50a1fde300e8c0a2","observation_id":"dfa662b9-857b-47f9-9c2f-ff9efc8b8e46","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Paris3D: Reasoning-based 3D part segmentation using large multimodal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:41cdb444a6f9ad9dad3f8964eebc28d3591605a60168cb4cd2530a0273fc77be","observation_id":"522528e5-b386-4a05-9928-bed4dee7463c","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Seeground: See and ground for zero-shot open-vocabulary 3D visual grounding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:d1273305a2ee87b981e44a704eb813a9d0794b3d6df244d9b728848b8c39b518","observation_id":"fb73473c-1e89-4159-a653-447a6e8293c3","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Instance segmentation in 3D scenes using semantic superpoint tree networks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:20d752ac79ad3be154dbc7591292dcd7b2acb5bfd1c90c6a47e7ecc0f215681a","observation_id":"f2dba8c2-9b2f-4e5c-905f-d8398ba08bc4","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Partslip: Low-shot part segmentation for 3D point clouds via pretrained image-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:517fe5464b30b11c3f35911d1ef810d8f1037e77d0c2fadd489b3165f86cbd1b","observation_id":"23742aa8-b1fc-4079-8d91-e5bdf64636e4","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:69ae8bad08e26200e6d28d774ee7a2b146d52ce3e3e7cbe4f766535c317610e4","observation_id":"a4f03636-dedf-4b50-ad3c-140accd43848","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"SQA3D: Situated question answering in 3D scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:6a45e76b2476e5c0d895f80fc059cfda2d2cafac39c655de5b9ab3a8bd381f56","observation_id":"68461a9c-4313-416c-819c-3f923628fa31","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.03426","last_updated":"2020-09-18T01:56:41Z","snapshot_observed_at":"2026-08-02T15:32:07.466568Z","submitted_at":"2018-02-09T19:39:33Z","title":"UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.03426","snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Umap: Uniform manifold approximation and projection for dimension reduction.arXiv preprint arXiv:1802.03426, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"cited_paper":"/paper/1802.03426","citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:3b04fdcd178cbc604b2e93701dacfb817213e71eee9335b92dcfeef0e7502238","observation_id":"c43534d9-1bd4-48ac-af7c-b3bd08fe0657","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"V-net: Fully convolutional neural networks for volumetric medical image segmentation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:9e0da861bc32754c8b285fbbdf235dd4e6430e9fda059b0295ae35e946061868","observation_id":"134c746c-0264-4265-91ea-6905405251f7","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Open3DIS: Open-vocabulary 3D instance segmentation with 2D mask guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:972131cf6bc6452132bb597fcb6878eb2f1e9e6f43e9a8795ab5fb94866e4db3","observation_id":"67aa20a1-04fb-463f-b0d6-5a8b0e6c753c","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"GPT-4 technical report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:9171c175fb59c767cf97fcc7eac9d0d53dd7f181f2207ae22a25849f096748ea","observation_id":"b663a8c1-58e5-464a-bfed-082d7fbdb180","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:da6b0cb98f9646c8bc69c8a35c017aa048f76dff0b9887b8c1ec8f52469b3339","observation_id":"6924e58b-26ee-4df7-8015-bd4fb938c96e","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"SAM 2: Segment anything in images and videos.arXiv preprint arXiv:2408.00714, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:bb8e5ffc4762a7a6cd3bbe55968a7a7758a5b77383f2aa90681bc3bba35a40ea","observation_id":"1d9b1836-1c10-48fe-a5fc-6a708f61e258","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Grounded SAM: Assembling open-world models for diverse visual tasks, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:cffbccf702e55614fd35779ba6f69c4600f2c8ef62a3c4b86eb0ed13808dd9b6","observation_id":"fcd577b1-6a99-4d49-a00b-260eaf299601","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Efficient 3D semantic segmentation with superpoint transformer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:bf1f69722b65291c057fe6df92dd8117836af34d413f03e5a7c471cdb5b07b16","observation_id":"34cee88d-ba9c-4fdd-bd42-1adf04fbe1f7","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:5dfdb8d6a8f59727f37561558d6242f09f80e7a15b6dd5956ef07612c2c4bc9b","observation_id":"a8c06fcf-11f4-4360-b6c8-8df467b95593","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"N3D-VLM: Native 3D grounding enables accurate spatial reasoning in vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:65f6e796833b13dfc003acdf274a608dc71cffa1a22e8a6aaccd0b316f7747ba","observation_id":"2d7f1781-bafd-404b-a0ee-6e0997152b74","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"3D-STMN: Dependency-driven superpoint-text matching network for end-to-end 3D referring expression segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:cdb559baa53f9b945d17ec34e353763bddbb247da94a2b3be73daa48c09561f6","observation_id":"2be777a8-db10-4ae9-9c3f-c5d3fcbe499f","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Eda: Explicit text-decoupling and dense alignment for 3D visual grounding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:9c5381ac41a0407342153147ebabbf50c82bb20a52944504ea4fb66624235191","observation_id":"1b62f83b-d8b6-430e-b4f7-c58eeff41f20","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"S 2-MLLM: Boosting spatial reasoning capability of mllms for 3D visual grounding with structural guidance.arXiv preprint arXiv:2512.01223, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:2012494a217f4e2ea36d9f4a6f56edee5e4a19de995a69908c672b4da756600c","observation_id":"ae6b6ffb-60c6-402c-991f-5eb1c79e4ed9","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"A unified framework for 3D scene understanding.Advances in Neural Information Processing Systems, 37:59468–59490, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:019aeaeeaa700083a30af6be2c5c066d5fe4d9758db4c1300338798bc3002e49","observation_id":"d2ec79d2-ff44-4537-83a3-bce9439fcbee","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Scannet++: A high-fidelity dataset of 3D indoor scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:42a50924d5efcdf44b9256d21a4a72d3db99859e8ea361d2f5ac3fce1b1f89e4","observation_id":"7ea99656-2dfd-4f80-85a3-1fea28f37b01","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Inst3d-lmm: Instance-aware 3D scene understanding with multi-modal instruction tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:40de950edff8a356baf39af397c7a347415bc4e715efa9ef98f737960ea8ee9f","observation_id":"2d9cc1e1-f181-4eda-9b4f-1f5aaf81c375","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Instancerefer: Cooperative holistic understanding for visual grounding on point clouds through instance multi-level contextual referring","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:13d29d34b99357f87a866bd3fab134e6b3c66dfe4c3c76d6db8686927d5dcb63","observation_id":"7b862ed8-e7f5-4655-a5f5-687f0eff9bc3","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"MM1.5: Methods, analysis & insights from multimodal LLM fine-tuning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:e573492303f4a79dc626267fa64ee43eba03e70b5ff47714fb50c6aad2762351","observation_id":"d7de9d14-5f50-4c0d-9d27-06052a9dc791","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"near the door","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:681fabeb8be08f693a9d99c626e1a9c4e4e7d32829e3117b1dfad06f085eb1d1","observation_id":"5d50611d-7e06-45a9-88e9-7348aebd6b9d","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:56a0ade2084139fbf83bffc8a297005c6c974ca884e2576985e3270fa55b86b4","observation_id":"c9cd55b6-8fbb-436f-9b59-c70159c17ddc","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:cebf1f3a96aa16059b8ba0511235dd10ac001e4ccb6e57691102deedc40fbe29","observation_id":"71b033a4-c645-42a8-97fe-a39b0c7ae8e9","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"to the left of the table","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:b56e8f724e1900538e92e90a9e41f6212e50174bcccc9d435b032acfe255351d","observation_id":"be97dda2-7df4-4469-917a-062517815351","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T14:23:57.247860Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":47,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2607.05493."}