{"as_of":"2026-08-19T10:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:11ffc81c4470dccfe3f03eb832ddc8f8246312a31c66137c5687a36a539c1328","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:38:21.624165Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:42:46.762264Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T01:00:51.232818Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01163","snapshot_observed_at":"2026-08-15T20:42:46.762264Z","title":"3d-llava: Towards generalist 3d lmms with omni superpoint transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12253","last_updated":"2025-05-18T06:18:57Z","snapshot_observed_at":"2026-08-18T08:02:43.826301Z","submitted_at":"2025-05-18T06:18:57Z","title":"LLaVA-4D: Embedding SpatioTemporal Prompt into LMMs for 4D Scene Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:42:46.762264Z"},"links":{"cited_paper":"/paper/2501.01163","citing_paper":"/paper/2505.12253"},"observation_digest":"sha256:739b9e0e9331dbd3b89560a3e6b93af549625889b1b976409c516cf42ac56d22","observation_id":"b735ca13-2ae1-4ac0-a97c-862e8cef45de","resolution":{"observed_at":"2026-08-15T20:42:46.762264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"cited_work":{"arxiv_id":"2501.01163","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01163","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"3d-llava: Towards generalist 3d lmms with omni superpoint transformer","venue":null,"work_id":"05d96bd0-6fe7-4dfe-b450-74de4e4bd063","year":2025},"citing_paper":{"arxiv_id":"2505.23747","last_updated":"2026-05-19T02:23:16Z","snapshot_observed_at":"2026-08-15T23:37:18.723910Z","submitted_at":"2025-05-29T17:59:04Z","title":"Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T08:34:36.824053Z"},"links":{"cited_paper":"/paper/2501.01163","citing_paper":"/paper/2505.23747"},"observation_digest":"sha256:ac98c5812a9749519cae1f40afa67d220caf8da35f5fc0dc5586399a9a774918","observation_id":"c441afbe-0c1b-4609-a8a9-d55ab5a1967a","resolution":{"observed_at":"2026-05-16T08:34:36.864611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"cited_work":{"arxiv_id":"2501.01163","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01163","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"3d-llava: Towards generalist 3d lmms with omni superpoint transformer","venue":null,"work_id":"05d96bd0-6fe7-4dfe-b450-74de4e4bd063","year":2025},"citing_paper":{"arxiv_id":"2505.23747","last_updated":"2026-05-19T02:23:16Z","snapshot_observed_at":"2026-08-15T23:37:18.723910Z","submitted_at":"2025-05-29T17:59:04Z","title":"Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T00:59:13.826054Z"},"links":{"cited_paper":"/paper/2501.01163","citing_paper":"/paper/2505.23747"},"observation_digest":"sha256:9adf00ab500ff45af4327215197ca4e5ca8d275760c0138c11d26975594b1936","observation_id":"16dbd855-9a29-4172-8260-00ea79ed4957","resolution":{"observed_at":"2026-05-22T01:00:51.236919Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01163","snapshot_observed_at":"2026-08-07T10:50:52.796197Z","title":"3d-llava: Towards generalist 3d lmms with omni superpoint transformer.arXiv preprint arXiv:2501.01163, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-17T15:58:43.868299Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.796197Z"},"links":{"cited_paper":"/paper/2501.01163","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:eb4bb44ccaae4d98cffc841a0c2c1dff5283b1d9b1a15b17f64232698cfed7aa","observation_id":"cfa85fcf-2cdf-4e1d-8934-7ba0409f6ef4","resolution":{"observed_at":"2026-08-07T10:50:52.796197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"cited_work":{"arxiv_id":"2501.01163","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01163","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"3d-llava: Towards generalist 3d lmms with omni superpoint transformer","venue":null,"work_id":"05d96bd0-6fe7-4dfe-b450-74de4e4bd063","year":2025},"citing_paper":{"arxiv_id":"2604.09167","last_updated":"2026-04-10T09:51:42Z","snapshot_observed_at":"2026-08-16T04:47:59.695653Z","submitted_at":"2026-04-10T09:51:42Z","title":"MAG-3D: Multi-Agent Grounded Reasoning for 3D Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T17:25:31.097385Z"},"links":{"cited_paper":"/paper/2501.01163","citing_paper":"/paper/2604.09167"},"observation_digest":"sha256:4ef9f631f5637bbb32887651a3e9b512ba0b07b29cbbce7a30e1d25b4dbca3e1","observation_id":"82d902a7-3186-4720-a85d-6957cb10f36d","resolution":{"observed_at":"2026-05-11T06:51:21.546294Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01163","snapshot_observed_at":"2026-08-12T15:33:29.320043Z","title":"3d-llava: Towards generalist 3d lmms with omni superpoint transformer.arXiv preprint arXiv:2501.01163, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-16T14:27:26.828874Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.320043Z"},"links":{"cited_paper":"/paper/2501.01163","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:d134f85b1eef43c8a33ebff9e88f188899f00b784cb2c127b1f1a947491a42c0","observation_id":"08779163-fc63-47d5-92c3-8e12b46253ba","resolution":{"observed_at":"2026-08-12T15:33:29.320043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.01163/citation-record","integrity":"/paper/2501.01163/integrity","json":"/paper/2501.01163/citation-record.json","paper":"/paper/2501.01163"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:22.940442Z","title":"Referit3d: Neural listeners for fine-grained 3d object identification in real-world scenes","venue":null,"work_id":"a209c1b0-d023-4762-a83d-1638baee843b","year":null},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.304040Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:2b54dab45324a704e8c19b4129c9b759d02af2e55c47ca78572955fbc562721e","observation_id":"888363c1-dff3-4a7b-8693-7180a188f73d","resolution":{"observed_at":"2026-08-10T22:38:22.962313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:21.312544Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.312544Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:d58120020c1fb4bef3d470de2142b9ec8733292e387f8c2ea1b9afdb05892afc","observation_id":"d6842355-1d5a-444b-bedb-5d9dd5945449","resolution":{"observed_at":"2026-08-10T22:38:21.312544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:22.832259Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":"9cc0d6c8-38d0-4475-a2c0-d88ddc3e75f0","year":2022},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.317517Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:5b90951123d09f1498502154e79617e7c6a6ba0ddf0801420f8a6fcdb38170c5","observation_id":"92779771-0203-4486-88c0-4f1ba3691bd8","resolution":{"observed_at":"2026-08-10T22:38:22.855494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:21.321204Z","title":"Lan- guage models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.321204Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:fb1e8069be8ec1546dab38f316c31ea0e80491f0d962e6f9170b4b5ce075034d","observation_id":"03a0081c-632f-4dc4-a330-e3e5497fac99","resolution":{"observed_at":"2026-08-10T22:38:21.321204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:21.325205Z","title":"Lan- guage models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.325205Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:ae4f6c97521687a1b972a5f1cff1b91a7aa936f6926737b2cd6253a974ee2e8c","observation_id":"71bf9048-bb15-4c38-90d4-c84ba2015eba","resolution":{"observed_at":"2026-08-10T22:38:21.325205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:22.759268Z","title":"3djcg: A unified framework for joint dense captioning and visual grounding on 3d point clouds","venue":null,"work_id":"53166300-cc4c-47bf-95af-647df657fe43","year":2022},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.329044Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:1b1971fa527ebbadc6afc5312facb6d2077f1a2c3e1e3c432e29fc773bf9ed4f","observation_id":"32d1d7ea-e996-4c19-9215-90674afccb5c","resolution":{"observed_at":"2026-08-10T22:38:22.778103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:22.677306Z","title":"Scanrefer: 3d object localization in rgb-d scans using natu- ral language","venue":null,"work_id":"c8fd6b86-042f-43e6-89b1-2b96cdde0adc","year":2020},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.332860Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:465731a3fa67288504690fae52a23ccb856fccbdab319c87c4dff2a8a8a1484a","observation_id":"7b180116-770f-45d4-9321-a6de978b9974","resolution":{"observed_at":"2026-08-10T22:38:22.704309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.01551","last_updated":"2022-07-22T11:49:32Z","snapshot_observed_at":"2026-08-19T01:37:46.680176Z","submitted_at":"2021-12-02T19:00:06Z","title":"D3Net: A Unified Speaker-Listener Architecture for 3D Dense Captioning and Visual Grounding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.01551","snapshot_observed_at":"2026-08-10T22:38:21.340614Z","title":"D3net: A speaker-listener architecture for semi-supervised dense captioning and visual grounding in rgb-d scans","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.340614Z"},"links":{"cited_paper":"/paper/2112.01551","citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:d587839c17057c88aa92e3e567ab00ac6113b2980008732583ceede1fafb841b","observation_id":"ad158610-2e48-438e-8253-f05e8e44240a","resolution":{"observed_at":"2026-08-10T22:38:21.340614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:22.611363Z","title":"End-to-end 3d dense captioning with vote2cap-detr","venue":null,"work_id":"efc4b7c4-80c6-425c-893d-460a6b86f59c","year":2023},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.344824Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:efe2d60ffa2ce6982dfa63a5d0c533582beef46cc67a053f72edc01ab4b01f15","observation_id":"3efbaee2-fb55-4c10-b2bd-ef18754cbc09","resolution":{"observed_at":"2026-08-10T22:38:22.643116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02999","last_updated":"2023-09-06T13:43:27Z","snapshot_observed_at":"2026-08-16T15:02:49.790051Z","submitted_at":"2023-09-06T13:43:27Z","title":"Vote2Cap-DETR++: Decoupling Localization and Describing for End-to-End 3D Dense Captioning","version":1},"cited_work":{"arxiv_id":"2309.02999","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.02999","snapshot_observed_at":"2026-08-10T22:38:21.842074Z","title":"Vote2Cap-DETR++: Decoupling Localization and Describing for End-to-End 3D Dense Captioning","venue":"cs.CV","work_id":"8aee05a5-16eb-497d-aafe-acf57cd5e3a0","year":2023},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.354622Z"},"links":{"cited_paper":"/paper/2309.02999","citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:4f507e8e1c30811b35683de9e679a0daf1bd4ee5e4f62d67527c90448f56d10b","observation_id":"55c2b2e9-af23-4074-b04f-751de9427cae","resolution":{"observed_at":"2026-08-10T22:38:21.845911Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:22.548768Z","title":"Ll3da: Visual interactive instruction tuning for omni-3d understand- ing reasoning and planning","venue":null,"work_id":"e18dd9fb-f4b2-4c6f-8930-2792f332bde8","year":2024},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.361785Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:9290e81218d0c18cdce220f333b8550acf80389fc3407a53adb377ee62d4a5ba","observation_id":"00233a35-9796-4d66-8433-75abe511b726","resolution":{"observed_at":"2026-08-10T22:38:22.577170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10370","last_updated":"2024-11-18T08:29:08Z","snapshot_observed_at":"2026-08-18T13:34:10.935081Z","submitted_at":"2024-05-16T18:03:41Z","title":"Grounded 3D-LLM with Referent Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10370","snapshot_observed_at":"2026-08-10T22:38:21.365509Z","title":"Grounded 3d-llm with referent tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.365509Z"},"links":{"cited_paper":"/paper/2405.10370","citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:cb13dec3b01ed7f3010e082bf547c82b86046a9ad47b2640355d2a76bd96876a","observation_id":"20e8b86a-ef1a-4642-9790-05f549fdf540","resolution":{"observed_at":"2026-08-10T22:38:21.365509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:22.472127Z","title":"Scan2cap: Context-aware dense captioning in rgb-d scans","venue":null,"work_id":"8c44ba77-30bf-4e43-b281-d87ec9cd3fc5","year":null},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.369436Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:5403a9b9c527889e14fcff4cf9f6769f1dd8406995413bf1ed9e07061fecf284","observation_id":"af20d30c-6eac-48c3-9ff3-7cb34d3ec6fe","resolution":{"observed_at":"2026-08-10T22:38:22.486472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:22.425007Z","title":"Unit3d: A unified trans- former for 3d dense captioning and visual grounding","venue":null,"work_id":"9910a113-00aa-488e-9d25-107c91b3f54a","year":2023},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.372993Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:3f6a0e0cae8f43231dd105abf53b708740ec9efdf09ef8f00f26ac71ecba8466","observation_id":"e3f787c6-4610-428c-a1cd-d692e906e049","resolution":{"observed_at":"2026-08-10T22:38:22.437822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:21.376268Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.376268Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:04b9fd2502e7bcd43de7af9378a1e6b716aa121d28ae66d1a6a6534ced13d125","observation_id":"9eacf99b-44d8-4fd2-83cb-613ea48634de","resolution":{"observed_at":"2026-08-10T22:38:21.376268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:21.379646Z","title":"4d spatio-temporal convnets: Minkowski convolutional neural networks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.379646Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:b2209b234f3d5cb504277a51bd871ceb5e205353ae7a76a9fe9d752db7035a80","observation_id":"d3025561-fdaf-4a2a-a96e-cc0fe084e127","resolution":{"observed_at":"2026-08-10T22:38:21.379646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:21.383295Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.383295Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:5d413dab11d1954286b529191b41b580a09038d5dad03250984ad7c8e999569a","observation_id":"ca065221-c100-446b-abc7-1e11dd280b46","resolution":{"observed_at":"2026-08-10T22:38:21.383295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:21.387006Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.387006Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:3ed299af3f3cba2aa2bbd11ad5cb1c76363858435e665050ed6f8234e500a615","observation_id":"33c19405-ee4b-474a-9f14-9859cc79fad0","resolution":{"observed_at":"2026-08-10T22:38:21.387006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:21.390503Z","title":"A density-based algorithm for discovering clusters in large spatial databases with noise","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.390503Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:c311eb64018b7467c257dae97af0ca2c6b37c5c31d63fccb17a0ec78c093e65b","observation_id":"3d7cfe24-58bf-4cf6-a63b-513c3b0e429a","resolution":{"observed_at":"2026-08-10T22:38:21.390503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11401","last_updated":"2024-03-22T18:52:51Z","snapshot_observed_at":"2026-08-17T15:42:36.096154Z","submitted_at":"2024-03-18T01:18:48Z","title":"Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11401","snapshot_observed_at":"2026-08-10T22:38:21.395235Z","title":"Scene-llm: Extending language model for 3d visual understanding and reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.395235Z"},"links":{"cited_paper":"/paper/2403.11401","citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:ed8509f0dc8fed89fbf028acd5de29b5615b29f464e580ef2ceef0586e3c8845","observation_id":"49e2eb89-8bb6-4a7e-8531-20716a010ce5","resolution":{"observed_at":"2026-08-10T22:38:21.395235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:22.343037Z","title":"Segpoint: Segment any point cloud via large language model","venue":null,"work_id":"ac21a9a6-a2c1-4c8d-afb5-1aef0776b799","year":2024},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.425392Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:aa3151750e6aba6ddec5e5bcc3d672621bc3c154885865a564a7636812c1b2df","observation_id":"13c49fe8-ad71-4d8c-b695-fb10e5cada30","resolution":{"observed_at":"2026-08-10T22:38:22.359552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-10T22:38:21.440041Z","title":"Training compute-optimal large language mod- els","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.440041Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:b57851e496a33db46ac0f22a0279d14f0e9d04ac7f6dfdf2abb8529e496ed478","observation_id":"36cc0668-c536-488c-9f56-9ac26d530e83","resolution":{"observed_at":"2026-08-10T22:38:21.440041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:22.296792Z","title":"3d-llm: In- 9 jecting the 3d world into large language models","venue":null,"work_id":"7ab58b8f-5a52-40ca-869c-cb6a243b95ef","year":null},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.453086Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:199d44999dfe065b857cde629b102c868ba151728320d0d077c8ccc60ef455f0","observation_id":"6ffa7714-17bc-441a-89b7-b30ecb338cab","resolution":{"observed_at":"2026-08-10T22:38:22.313257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-17T18:04:53.578114Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-10T22:38:21.464197Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.464197Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:c200b55d0ec6f49feb901777fb987f73c7d7bd1099ed4b23a397c3dab6cd2124","observation_id":"e2a88b52-3c15-43dc-ae05-bbc3781585b8","resolution":{"observed_at":"2026-08-10T22:38:21.464197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:22.257944Z","title":"Chat-scene: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":"062bef77-438a-4a0b-a4b5-363e2095c325","year":2024},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.468717Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:7648aff4b0104e0ee58e799ab6647efdffc41118083edad5dfdf53fe7bdb752f","observation_id":"aeda7315-d3a4-4bad-a110-25fbff11d612","resolution":{"observed_at":"2026-08-10T22:38:22.276860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12871","last_updated":"2024-05-09T17:35:44Z","snapshot_observed_at":"2026-08-05T10:01:43.401012Z","submitted_at":"2023-11-18T01:21:38Z","title":"An Embodied Generalist Agent in 3D World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12871","snapshot_observed_at":"2026-08-10T22:38:21.473130Z","title":"An embodied generalist agent in 3d world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.473130Z"},"links":{"cited_paper":"/paper/2311.12871","citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:d3250d7c719c05213b7b179ac5b090940bfb4295213dd735d081ed22c7aef740","observation_id":"f6ce3afe-e49e-4af4-8e7d-189065fe2983","resolution":{"observed_at":"2026-08-10T22:38:21.473130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17427","last_updated":"2025-02-09T07:32:21Z","snapshot_observed_at":"2026-08-16T13:48:56.253610Z","submitted_at":"2024-05-27T17:59:41Z","title":"Reason3D: Searching and Reasoning 3D Segmentation via Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17427","snapshot_observed_at":"2026-08-10T22:38:21.477005Z","title":"Reason3d: Searching and reasoning 3d segmentation via large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.477005Z"},"links":{"cited_paper":"/paper/2405.17427","citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:0b00121ae8b2fccb27d71459a74b7d2159566e256e71011988b5c92b0ac8f0b7","observation_id":"71b3d911-595e-4caf-8769-8212050dfea6","resolution":{"observed_at":"2026-08-10T22:38:21.477005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:22.201740Z","title":"Text-guided graph neural networks for re- ferring 3d instance segmentation","venue":null,"work_id":"132266b6-77a7-43b1-a65c-476d42073b25","year":2021},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.481578Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:2d300cce0dee95a8b253d904b92e389c161a664654b0fc50dbdd2ad049555935","observation_id":"a2197ecb-b74c-468d-8667-43ef23731294","resolution":{"observed_at":"2026-08-10T22:38:22.239976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:22.142666Z","title":"Multi- view transformer for 3d visual grounding","venue":null,"work_id":"39be4ecc-0d93-44e9-b793-60793c8e8351","year":2022},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.484693Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:af331b5be05dc20f72d04cd2b56315b9e361542c208d6045d5b8409843b7757b","observation_id":"c2d8902b-5f69-495d-9ba4-d24797693deb","resolution":{"observed_at":"2026-08-10T22:38:22.166653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:22.123367Z","title":"Oneformer: One transformer to rule universal image segmentation","venue":null,"work_id":"ac3c2d09-35d0-4659-a944-8cef6dc80b3c","year":2023},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.487999Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:8843ca0e5cf4e8a6be9a27ac79e0d44d03017722332b53707487728fbb0895a5","observation_id":"57b31f50-339a-444c-95b7-ff41fff1ab5a","resolution":{"observed_at":"2026-08-10T22:38:22.127546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.05203","last_updated":"2022-07-20T16:04:15Z","snapshot_observed_at":"2026-08-16T17:15:40.188251Z","submitted_at":"2022-03-10T07:26:15Z","title":"MORE: Multi-Order RElation Mining for Dense Captioning in 3D Scenes","version":2},"cited_work":{"arxiv_id":"2203.05203","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.05203","snapshot_observed_at":"2026-08-10T22:38:21.764938Z","title":"MORE: Multi-Order RElation Mining for Dense Captioning in 3D Scenes","venue":"cs.CV","work_id":"b973141a-6b2b-4a34-9fc3-6c464c2646e8","year":2022},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.491774Z"},"links":{"cited_paper":"/paper/2203.05203","citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:664046f2fdcbed393b086f568050888d6bdaaa83138eaab5e4dcc389c781e302","observation_id":"ee970a3b-4264-43ca-a5e0-a1e0b207c96a","resolution":{"observed_at":"2026-08-10T22:38:21.770912Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:22.112938Z","title":"Tod3cap: Towards 3d dense captioning in outdoor scenes","venue":null,"work_id":"14d79f03-7bb6-40a7-9be6-f84adc42eb1c","year":2024},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.495053Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:cc05193ed2426a6c6c1ac6802932aff47f4a7f0803a7d180a85de02c1688bd3c","observation_id":"2208f299-cb9a-48c0-ae37-1373c9c0b1a4","resolution":{"observed_at":"2026-08-10T22:38:22.116245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:22.102680Z","title":"Context-aware alignment and mutual masking for 3d- language pre-training","venue":null,"work_id":"95a3ba34-9670-4985-902b-5e466c31d940","year":2023},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.499102Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:af696ff4efd41ea32c61add55f87c6a4f6337c4774800ae1d7f6a966bedde8f7","observation_id":"64d0f10c-3d58-4d1d-a8fa-441bfe7b70a7","resolution":{"observed_at":"2026-08-10T22:38:22.106042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:22.092923Z","title":"Bi-directional contextual attention for 3d dense captioning","venue":null,"work_id":"70b86f0f-1d95-498e-80a8-bad665e955c5","year":2024},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.504199Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:5ab78fb22d3f77b6b55ee4eacb9a5717d90f6070d35d38ddedeace11b0375ac4","observation_id":"b4d81e63-0fe6-4ca5-a2a6-a410ccbb8ed0","resolution":{"observed_at":"2026-08-10T22:38:22.096317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:22.083303Z","title":"Oneformer3d: One transformer for unified point cloud segmentation","venue":null,"work_id":"8d951ca0-fed3-41b5-99da-01064ee22e82","year":2024},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.508129Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:a7e75adf436b2b822f29da59ce73b96e8fd53252ed8cf8872698a3a1c629ebe6","observation_id":"e28d0ccb-4417-4116-b318-c24fd5fa7d20","resolution":{"observed_at":"2026-08-10T22:38:22.086848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:22.072646Z","title":"Mask-attention-free transformer for 3d in- stance segmentation","venue":null,"work_id":"904d8f42-7e43-473a-b49b-2bb6004a1449","year":null},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.511433Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:b4d577f5d11e6c709be734d79ecea202f78d069ab77b24495f6671fd3c71da3f","observation_id":"a7455c13-ae39-4dc1-af48-37254b701cf9","resolution":{"observed_at":"2026-08-10T22:38:22.076558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:22.062070Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":"bd104c5c-749a-4baf-b750-d25732e14386","year":2024},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.515719Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:16bcfd59c2b735977d2ca7055af0c17f6d5ebee4d65ecd3b6ef214f603ba8259","observation_id":"82af0fb9-3ffe-443a-9cf5-2b0b752b3645","resolution":{"observed_at":"2026-08-10T22:38:22.065918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:22.051117Z","title":"Large-scale point cloud semantic segmentation with superpoint graphs","venue":null,"work_id":"c3aa550d-452a-411d-b080-8ccf628b9cdf","year":2018},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.519220Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:ffe939a3e202139498c5a0617b40b8cf868ceea77fb8d28d8117e6ec2b1845c7","observation_id":"88d3bb10-aa68-42c7-a584-8ca93419ae35","resolution":{"observed_at":"2026-08-10T22:38:22.054980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-12T12:01:54.105712Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-10T22:38:21.522463Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.522463Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:3f1481e0d7352624e0a9dad08ce0bd542c2b8beb2ea73e0a158c2080158dd967","observation_id":"12db2c66-d551-4c76-8f57-443b017ba61a","resolution":{"observed_at":"2026-08-10T22:38:21.522463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-10T22:38:21.526491Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.526491Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:2bd0d6a6faec2efd5fcff5193cb9666e92a5c43d6c8f6519d177b0df88a4288a","observation_id":"9fd1d6e1-c061-46c3-930f-599d1d9cbb0b","resolution":{"observed_at":"2026-08-10T22:38:21.526491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:22.041014Z","title":"Sparsebev: High-performance sparse 3d object de- tection from multi-camera videos","venue":null,"work_id":"49f0f18c-426d-457b-86b0-981d12dc8005","year":2023},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.530014Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:a584939ac41a085105d8dc036bae562540003c2293eaa195af99efab6f1552d3","observation_id":"f7fa5907-153b-4eb8-ae1f-ac33bc4e2416","resolution":{"observed_at":"2026-08-10T22:38:22.044494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:22.030344Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"92773178-86fa-4045-ab43-1fab9504bcac","year":2024},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.534340Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:017fc7f541288be6a41d5c3716e3196f8018adda6075b31d39e076203470108d","observation_id":"4ff97781-8532-42f5-a51e-c7a6bea2ffd3","resolution":{"observed_at":"2026-08-10T22:38:22.034319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:22.019651Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90quality, 2023","venue":null,"work_id":"87338cd7-25bf-47f3-a297-139db3906182","year":2023},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.537855Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:fb1548b5e4fa30a29304fec811330226ec38274ea800099fd752484ee434abb6","observation_id":"1c5c1887-09f9-4ddb-af7a-ec474210340f","resolution":{"observed_at":"2026-08-10T22:38:22.023125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-10T22:38:21.541249Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.541249Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:7cf3e627cb4f03ad652ca6d486698eba48e294e218903927a3598d02bc6576c7","observation_id":"88c484b1-9a0e-4456-9a8e-bce52bb091a6","resolution":{"observed_at":"2026-08-10T22:38:21.541249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:22.009174Z","title":"Clip-guided vision-language pre-training for question answering in 3d scenes","venue":null,"work_id":"a626a57f-46a4-47cf-803a-25ba48408b26","year":2023},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.545029Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:af82d381c717a78e79f14ebaad618d93f3cdc77b857b6c5a56828a5a4fbbeab6","observation_id":"64daf037-cda0-4116-95d2-d465018b5676","resolution":{"observed_at":"2026-08-10T22:38:22.013185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:21.998407Z","title":"Openscene: 3d scene understanding with open vocabularies","venue":null,"work_id":"f94a7ce9-97ac-4a47-9d64-7d22e687bfa0","year":2023},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.548433Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:94751e3a7f9843a4e9d35c1ffebf849ffe22805560beff061939f99a6b7e34f9","observation_id":"4a2aae5a-0b39-4954-a83a-b6418e4523ed","resolution":{"observed_at":"2026-08-10T22:38:22.002593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:21.987645Z","title":"Pointnet++: Deep hierarchical feature learning on point sets in a metric space","venue":null,"work_id":"dba8e371-e270-4676-b5ac-1f38100c3e83","year":2017},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.552351Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:2efce54b08caa940abb6c5e56fc22f5aa134b0c7e17cf6745d62f88dd95390ba","observation_id":"0b459fd9-c9a4-4ff5-8553-64531e4efe7b","resolution":{"observed_at":"2026-08-10T22:38:21.991393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:21.975998Z","title":"X- refseg3d: Enhancing referring 3d instance segmentation via structured cross-modal graph neural networks","venue":null,"work_id":"dfcb64ce-fa9b-4342-98b0-04f5db013340","year":2024},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.555749Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:49cc05e7d5385b9ffd0772349452fe3bf3af9abb48c6dc3cebb567c4cbc9124b","observation_id":"56fdd562-5f10-4944-9426-7270d0d4b1f7","resolution":{"observed_at":"2026-08-10T22:38:21.980346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:21.560097Z","title":"Language models are unsu- pervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.560097Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:d2cb2db99c48e86df074b30edc288e62513b04132f4a6819cd76ebd788e9f62b","observation_id":"466c5048-85b4-4814-9487-483ccaa36e9f","resolution":{"observed_at":"2026-08-10T22:38:21.560097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:21.563660Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.563660Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:af79d2035552742e980b7175bd888cf2975090d2365442d8a21f943f8fb74478","observation_id":"1f541a13-c5cd-4d78-bd9c-d10e5dec5e4f","resolution":{"observed_at":"2026-08-10T22:38:21.563660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:21.567100Z","title":"Language- grounded indoor 3d semantic segmentation in the wild","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.567100Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:8ff5d24bc0ee4a235000ba9cd96bd75cc18af13d79bfb0006189d5868bd79e89","observation_id":"f856169c-932c-428c-9c52-6408d637adfe","resolution":{"observed_at":"2026-08-10T22:38:21.567100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:21.945479Z","title":"Mask3d: Mask trans- former for 3d semantic instance segmentation","venue":null,"work_id":"85518d4a-ecbe-42db-ad32-cdabb1a45537","year":2023},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.570410Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:fab1fb6c822fa80cb0af6142baffe0ea8b3b4817258a2cd027d06b8aab143478","observation_id":"b213143b-3088-4bfc-8a8e-adf2d5a51114","resolution":{"observed_at":"2026-08-10T22:38:21.949511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:21.934569Z","title":"Superpoint transformer for 3d scene instance segmentation","venue":null,"work_id":"fbff1e49-64d6-46d2-b5a7-3558d9905c8f","year":2023},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.573546Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:b6b125d1911b5b78e071a8591301c892e364a9153a60e6df2e88ada9ce42a9b9","observation_id":"d101734e-f423-4331-9cf6-be9cd14347b7","resolution":{"observed_at":"2026-08-10T22:38:21.938590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-10T22:38:21.576753Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.576753Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:2e509fac237a0135725c490010a6ad1e109cee9bf91999c7c81ac0108ee79686","observation_id":"a496371f-7daf-445e-a63e-a0b161bc5da1","resolution":{"observed_at":"2026-08-10T22:38:21.576753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T22:38:21.580213Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.580213Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:a296d70c3daa175c23d08c7a7701502f16bbaeb333a0d0c8868d0f73e489e48c","observation_id":"0fa5dcfa-41e3-4cbe-985b-b1a04a730b44","resolution":{"observed_at":"2026-08-10T22:38:21.580213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:21.923118Z","title":"Four ways to improve verbo-visual fusion for dense 3d visual grounding","venue":null,"work_id":"42933180-c707-4261-b9a1-ed507a8ab1e0","year":2024},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.583315Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:96fc1a404ad4fcaf4af231cecac93893c1f60fbb63d938b57f2ac79af925b5d7","observation_id":"d9b82dab-2c4e-4a4d-8b13-ae2085e4023f","resolution":{"observed_at":"2026-08-10T22:38:21.927085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.10688","last_updated":"2022-04-22T13:07:37Z","snapshot_observed_at":"2026-08-17T01:11:42.292456Z","submitted_at":"2022-04-22T13:07:37Z","title":"Spatiality-guided Transformer for 3D Dense Captioning on Point Clouds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.10688","snapshot_observed_at":"2026-08-10T22:38:21.586317Z","title":"Spatiality-guided transformer for 3d dense captioning on point clouds","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.586317Z"},"links":{"cited_paper":"/paper/2204.10688","citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:61fb37976b5ba22c843a3b01ea10704feda4fd1ce2ccafc40746ae38bc1b5053","observation_id":"deeb111e-a2ff-488b-a6de-806879e07375","resolution":{"observed_at":"2026-08-10T22:38:21.586317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:21.911163Z","title":"3d-stmn: Dependency- driven superpoint-text matching network for end-to-end 3d referring expression segmentation","venue":null,"work_id":"c7e2d483-1ae6-42e5-ad1f-eb44802503bc","year":2024},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.590789Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:95c16fca919714a3db0eaccfeb5b395b01091d8ddff9bcc71b8f7fd17680ed01","observation_id":"f3c05a8e-d8d7-418d-8d22-2533a7dbf8bf","resolution":{"observed_at":"2026-08-10T22:38:21.914969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16911","last_updated":"2024-09-06T22:45:43Z","snapshot_observed_at":"2026-08-16T15:04:12.996129Z","submitted_at":"2023-08-31T17:59:46Z","title":"PointLLM: Empowering Large Language Models to Understand Point Clouds","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16911","snapshot_observed_at":"2026-08-10T22:38:21.594099Z","title":"Pointllm: Empowering large language models to understand point clouds","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.594099Z"},"links":{"cited_paper":"/paper/2308.16911","citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:94b5c0d745d1b017c346e91c0d57f57119cf69beaf388dcf8bf0014faa13cc6c","observation_id":"e00940a1-fa89-420c-abb2-07f3d0ab5619","resolution":{"observed_at":"2026-08-10T22:38:21.594099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:21.900664Z","title":"Sat: 2d semantics assisted training for 3d visual grounding","venue":null,"work_id":"b40b551c-7166-4273-a18a-9a68e3964cad","year":2021},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.597693Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:c30d4772b538f430f3b4c72c35c4a42dd3c9d973887e1c294261141d3445f442","observation_id":"16d1c125-bdcd-428e-9e68-1a8d68657e75","resolution":{"observed_at":"2026-08-10T22:38:21.904223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:21.889614Z","title":"X-trans2cap: Cross- modal knowledge transfer using transformer for 3d dense captioning","venue":null,"work_id":"45497675-f2b5-4a4e-81b1-825646118399","year":2022},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.600989Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:781a0d6266e47aba1153c55687e3dcbeceb8a3494c823ec598c8e3a972951930","observation_id":"2a36d1f9-6cbc-4428-ba3f-63cf1e97cb01","resolution":{"observed_at":"2026-08-10T22:38:21.893500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11835","last_updated":"2024-03-18T14:47:03Z","snapshot_observed_at":"2026-08-16T14:08:46.652701Z","submitted_at":"2024-03-18T14:47:03Z","title":"Agent3D-Zero: An Agent for Zero-shot 3D Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11835","snapshot_observed_at":"2026-08-10T22:38:21.604533Z","title":"Agent3d-zero: An agent for zero-shot 3d understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.604533Z"},"links":{"cited_paper":"/paper/2403.11835","citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:d963e926bdb07c5aba90fda6d2c29976681fb48b3d50e5a10c21a51054ea06d1","observation_id":"4a4369bd-209d-4062-87b9-7a32805e4a8f","resolution":{"observed_at":"2026-08-10T22:38:21.604533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19389","last_updated":"2024-10-01T06:07:24Z","snapshot_observed_at":"2026-08-16T14:50:08.427255Z","submitted_at":"2024-06-27T17:59:01Z","title":"OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19389","snapshot_observed_at":"2026-08-10T22:38:21.608432Z","title":"Omg-llava: Bridging image-level, object-level, pixel-level reasoning and understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.608432Z"},"links":{"cited_paper":"/paper/2406.19389","citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:afc533c4250d9191ed038ca3f2f73906044a9987b17b24d0a911eac66467c080","observation_id":"f85724c3-f37a-4faf-a3ca-4ebca065201a","resolution":{"observed_at":"2026-08-10T22:38:21.608432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:21.874457Z","title":"Multi3drefer: Grounding text description to multiple 3d ob- jects","venue":null,"work_id":"de727b01-de55-4d08-a6c1-cccfa6852787","year":2023},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.611886Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:4b822b9783f6d95131a778e0a9ad7fb781a1801de77ec0fd3483c9c7874e2998","observation_id":"4a3f066d-daef-475d-8890-51c36c419dac","resolution":{"observed_at":"2026-08-10T22:38:21.881949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03925","last_updated":"2022-10-08T05:33:00Z","snapshot_observed_at":"2026-08-18T23:02:26.548308Z","submitted_at":"2022-10-08T05:33:00Z","title":"Contextual Modeling for 3D Dense Captioning on Point Clouds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03925","snapshot_observed_at":"2026-08-10T22:38:21.616056Z","title":"Contextual modeling for 3d dense captioning on point clouds","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.616056Z"},"links":{"cited_paper":"/paper/2210.03925","citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:475008478a2c04f0e88051f10106d98102fdd8674684cdad1e80f99f71c90d01","observation_id":"8e5d5896-b9de-4d90-a357-7632483ddb84","resolution":{"observed_at":"2026-08-10T22:38:21.616056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-10T22:38:21.620323Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.620323Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:9e7227380bdfeb3a1ee553094972824b70d0733620472086f77cfee98defee49","observation_id":"20cf3ff7-b3d8-47a0-8303-cf08584a3259","resolution":{"observed_at":"2026-08-10T22:38:21.620323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:21.863085Z","title":"3d-vista: Pre-trained transformer for 3d vision and text alignment","venue":null,"work_id":"dd11378c-f6da-4d5f-bbf8-c3cc72d8f73a","year":2023},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.624165Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:6be7cd6951ac23780cd63dc54ce9cd30df783c0e2ca21317cf191cc9bdb8ac4e","observation_id":"3291e147-aded-4c1a-a830-24c6d28a20f9","resolution":{"observed_at":"2026-08-10T22:38:21.866923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:22.910328Z","title":null,"venue":null,"work_id":"88e7d3b2-06cd-4961-9b7d-9006bda3f573","year":2020},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":440,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.308636Z"},"links":{"citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:4dfc03f82ccdb83d7d8103d0296064eff0a0761a0a7b90f92a94124cd00adf57","observation_id":"4f1d636c-c6c8-451c-bee0-2bc6b5e634ea","resolution":{"observed_at":"2026-08-10T22:38:22.925089Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":29,"verified_exact":2,"verified_fuzzy":36},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 6 inbound Pith citation observations for arXiv:2501.01163."}