{"as_of":"2026-08-21T19:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0e04c3acc99f1f37a2bd8e109c5d5d918b30c08a51dabef1d377a84d1c191640","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":59,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:03:16.395096Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T03:09:29.321784Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":"2309.00615","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-07-04T03:09:29.321784Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":"99ba2617-dd10-4f2d-bb63-cc88e743aa78","year":2023},"citing_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-13T10:46:50.834601Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"reference_index":109,"source":"arxiv_source","source_observed_at":"2026-05-14T23:07:42.245641Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2303.16199"},"observation_digest":"sha256:00f1a623273f396f97cb39329a07687dc794700807b716514a7de5dce7d75d9c","observation_id":"c7239216-2861-4a65-ace9-fbe23b8d32f4","resolution":{"observed_at":"2026-05-14T23:07:42.622601Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":"2309.00615","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-07-04T03:09:29.321784Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":"99ba2617-dd10-4f2d-bb63-cc88e743aa78","year":2023},"citing_paper":{"arxiv_id":"2311.07575","last_updated":"2023-11-13T18:59:47Z","snapshot_observed_at":"2026-08-13T14:59:44.917623Z","submitted_at":"2023-11-13T18:59:47Z","title":"SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T03:03:26.723464Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2311.07575"},"observation_digest":"sha256:0af50110cd6134450118adf51f0269c311205e85b263f8f3bdb6d776f67b97f4","observation_id":"2b2ea280-db75-4de4-bd15-237819b722e0","resolution":{"observed_at":"2026-05-17T03:03:26.883172Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":"2309.00615","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-07-04T03:09:29.321784Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":"99ba2617-dd10-4f2d-bb63-cc88e743aa78","year":2023},"citing_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-13T03:52:04.619847Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T01:29:30.032408Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2403.14624"},"observation_digest":"sha256:d435ede6c937e51a9ba70b01ef09767d7a2f47fd2edcebc256e674106638b367","observation_id":"63e58c97-9553-4247-933f-e64629c117d9","resolution":{"observed_at":"2026-05-17T01:29:30.121405Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":"2309.00615","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-07-04T03:09:29.321784Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":"99ba2617-dd10-4f2d-bb63-cc88e743aa78","year":2023},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:56b6a6d8f4c905caaaae54261b359ae1ef056c70aac559d4dabf015c64c86192","observation_id":"080577c8-4f50-4d7f-a6ab-4f3b2ac2b91e","resolution":{"observed_at":"2026-05-11T06:01:54.075378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":"2309.00615","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-07-04T03:09:29.321784Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":"99ba2617-dd10-4f2d-bb63-cc88e743aa78","year":2023},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:7228eb846016e46fa3d120b73d2e505b3dccaa8277e04d58b667c0892f3188d9","observation_id":"ee4d18be-d8a8-4d3a-8433-57f5ae56d34d","resolution":{"observed_at":"2026-05-10T14:23:49.552473Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":"2309.00615","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-07-04T03:09:29.321784Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":"99ba2617-dd10-4f2d-bb63-cc88e743aa78","year":2023},"citing_paper":{"arxiv_id":"2410.14702","last_updated":"2026-05-10T19:30:43Z","snapshot_observed_at":"2026-08-19T19:02:34.472298Z","submitted_at":"2024-10-06T20:35:41Z","title":"Polymath: A Challenging Multi-modal Mathematical Reasoning Benchmark","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-23T20:03:38.336841Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2410.14702"},"observation_digest":"sha256:5ca554e3c2af14d0675b05a13db227e8014de2152af0a4221727066d6e81f6e5","observation_id":"6b4cb0ed-a327-4aff-827a-e27a4f09a8dc","resolution":{"observed_at":"2026-05-23T20:05:47.810561Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-12T16:46:09.898818Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-18T11:12:16.313412Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.898818Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:8f0788eda671b938cc88df96ba9258d53eeb31a1f9ec7f68cbe58c2a951a171e","observation_id":"e5f36373-22e4-4d0a-8927-2f1f0ca5b3ce","resolution":{"observed_at":"2026-08-12T16:46:09.898818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-12T15:47:37.115653Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13927","last_updated":"2025-08-03T11:03:07Z","snapshot_observed_at":"2026-08-16T01:48:31.510204Z","submitted_at":"2024-11-21T08:22:45Z","title":"Multimodal 3D Reasoning Segmentation with Complex Scenes","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T15:47:37.115653Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2411.13927"},"observation_digest":"sha256:b7f4496a5cee2c4c172d5a7c37aba2405e5ea8aebf29b6a54c443e60e0f65e9d","observation_id":"79aa4343-2b7f-46b8-9a49-10707bb728af","resolution":{"observed_at":"2026-08-12T15:47:37.115653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-12T13:35:40.800734Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understand- ing, generation, and instruction following","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16773","last_updated":"2024-11-27T07:45:45Z","snapshot_observed_at":"2026-08-21T14:05:11.294029Z","submitted_at":"2024-11-25T06:57:28Z","title":"MICAS: Multi-grained In-Context Adaptive Sampling for 3D Point Cloud Processing","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T13:35:40.800734Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2411.16773"},"observation_digest":"sha256:2448590f7734a9b6424ad168f564ad44f3f8ba7f25385c35bf762720c2814f3c","observation_id":"c42e3d4c-4679-49c7-b7ef-9aff57d943c2","resolution":{"observed_at":"2026-08-12T13:35:40.800734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-12T12:52:10.167237Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understand- ing, generation, and instruction following","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16856","last_updated":"2025-03-23T07:01:53Z","snapshot_observed_at":"2026-08-19T20:56:22.352625Z","submitted_at":"2024-11-25T19:00:05Z","title":"SAR3D: Autoregressive 3D Object Generation and Understanding via Multi-scale 3D VQVAE","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T12:52:10.167237Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2411.16856"},"observation_digest":"sha256:4aae4504ba83d8e9ece2ddd10c1803a6344c5e7b87088f725203453b33f19493","observation_id":"d718883a-8478-4927-8f57-37d366037e8d","resolution":{"observed_at":"2026-08-12T12:52:10.167237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-12T11:06:12.864682Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understand- ing, generation, and instruction following","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18623","last_updated":"2024-12-14T18:38:03Z","snapshot_observed_at":"2026-08-17T15:33:20.353144Z","submitted_at":"2024-11-27T18:59:52Z","title":"Lift3D Foundation Policy: Lifting 2D Large-Scale Pretrained Models for Robust 3D Robotic Manipulation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T11:06:12.864682Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2411.18623"},"observation_digest":"sha256:c02d969bba57de264a271cea906385b95cfdfa583ecac0c27c8442cfc7745178","observation_id":"e390967d-dcdd-425c-ac04-c8266c754a76","resolution":{"observed_at":"2026-08-12T11:06:12.864682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-12T04:35:36.836304Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understand- ing, generation, and instruction following","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-19T10:09:56.914941Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:36.836304Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:d893f54350c236591cb3f60d7643ef6ebcc85f1332654bee9604bc14e1d65b4f","observation_id":"a4448104-fa27-41da-bf9f-d48299e08c4d","resolution":{"observed_at":"2026-08-12T04:35:36.836304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-11T19:31:43.815043Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06660","last_updated":"2024-12-09T16:59:35Z","snapshot_observed_at":"2026-08-13T09:14:45.905037Z","submitted_at":"2024-12-09T16:59:35Z","title":"MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T19:31:43.815043Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2412.06660"},"observation_digest":"sha256:369c95c85ba93c27b2f02e4da4a0d0ed6356ec9954eb6db6af32f997774cdc8f","observation_id":"c601d7a0-ab0d-4afa-92ed-e20d9e70784c","resolution":{"observed_at":"2026-08-11T19:31:43.815043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-11T04:55:17.081012Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18277","last_updated":"2025-08-04T02:46:55Z","snapshot_observed_at":"2026-08-18T13:42:14.970744Z","submitted_at":"2024-12-24T08:38:35Z","title":"Towards Modality Generalization: A Benchmark and Prospective Analysis","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T04:55:17.081012Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2412.18277"},"observation_digest":"sha256:97108009efc9130c96e0399e34bbb1830bc7125d791dc059434017f097277e87","observation_id":"296da122-4568-4268-9d3a-54963c89ba5a","resolution":{"observed_at":"2026-08-11T04:55:17.081012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-10T22:32:55.301412Z","title":"Point- bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01428","last_updated":"2025-03-11T07:54:04Z","snapshot_observed_at":"2026-08-15T04:16:11.827389Z","submitted_at":"2025-01-02T18:59:59Z","title":"GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:55.301412Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2501.01428"},"observation_digest":"sha256:37c4aa397a40acd181dd302fb36f179124244487c7aa01a45401efdb6b2f25e5","observation_id":"088d3bb2-e42d-4c43-84b7-89d1750a40bf","resolution":{"observed_at":"2026-08-10T22:32:55.301412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-10T22:19:56.250068Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02285","last_updated":"2025-01-07T13:38:34Z","snapshot_observed_at":"2026-08-17T22:25:59.554866Z","submitted_at":"2025-01-04T13:27:18Z","title":"Hyperbolic Contrastive Learning for Hierarchical 3D Point Cloud Embedding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:56.250068Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2501.02285"},"observation_digest":"sha256:3504f8e0fd911fb2df4a88ac61df28989b3f658c67ca8464315bb885d9d8f732","observation_id":"3a9a78d0-17a9-47c7-9e3f-86ad738ffc39","resolution":{"observed_at":"2026-08-10T22:19:56.250068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-10T21:48:26.988637Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03879","last_updated":"2025-01-07T15:42:32Z","snapshot_observed_at":"2026-08-15T00:27:44.617873Z","submitted_at":"2025-01-07T15:42:32Z","title":"CL3DOR: Contrastive Learning for 3D Large Multimodal Models via Odds Ratio on High-Resolution Point Clouds","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T21:48:26.988637Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2501.03879"},"observation_digest":"sha256:dc6d4574a192345fce3c12284c3af9d04ee97ffc355cd6ed5411bbcbe264ad44","observation_id":"ea930fc1-ced0-4f12-be11-471d0703ff7e","resolution":{"observed_at":"2026-08-10T21:48:26.988637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-10T15:31:35.517200Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13920","last_updated":"2025-01-23T18:58:33Z","snapshot_observed_at":"2026-08-19T09:38:20.494324Z","submitted_at":"2025-01-23T18:58:33Z","title":"IMAGINE-E: Image Generation Intelligence Evaluation of State-of-the-art Text-to-Image Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T15:31:35.517200Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2501.13920"},"observation_digest":"sha256:5364337a460e3321b7e8e914c284649003331166721f76b102234a24a1e7fa8a","observation_id":"147724f4-f3a0-4a5f-928d-2feeb035c551","resolution":{"observed_at":"2026-08-10T15:31:35.517200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-10T15:32:46.195022Z","title":"arXiv preprint arXiv:2309.00615 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13926","last_updated":"2025-07-23T16:09:10Z","snapshot_observed_at":"2026-08-19T17:50:55.743272Z","submitted_at":"2025-01-23T18:59:43Z","title":"Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T15:32:46.195022Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2501.13926"},"observation_digest":"sha256:f861eaf8fb5dc7222eaa4bc789c9e527ab5fad5404663790087426e1dbdc608a","observation_id":"6d5d7674-a9f3-4190-b90c-9bcdb95d3c78","resolution":{"observed_at":"2026-08-10T15:32:46.195022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-16T12:03:16.395096Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13995","last_updated":"2025-04-18T18:00:00Z","snapshot_observed_at":"2026-08-20T18:12:03.620581Z","submitted_at":"2025-04-18T18:00:00Z","title":"Scaling LLaNA: Advancing NeRF-Language Understanding Through Large-Scale Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T12:03:16.395096Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2504.13995"},"observation_digest":"sha256:8efb29eeb781ea4f72645b42a5933bdbdbb25e2cba8cea2005a822627fffd6fa","observation_id":"24ffe4b5-2dae-4888-a3ad-20a8aa220429","resolution":{"observed_at":"2026-08-16T12:03:16.395096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-16T11:33:47.123124Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15279","last_updated":"2025-04-21T17:59:53Z","snapshot_observed_at":"2026-08-18T11:09:01.459046Z","submitted_at":"2025-04-21T17:59:53Z","title":"VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:33:47.123124Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2504.15279"},"observation_digest":"sha256:4846f3ea944403deb447b2014b37dbdc4f73693aa84de1041e1c3ee6edf47560","observation_id":"57daca8a-8f45-4737-a16f-2604620fa634","resolution":{"observed_at":"2026-08-16T11:33:47.123124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-16T10:39:54.386245Z","title":"Point-Bind & Point-LLM: Aligning point cloud with multi-modality for 3D understanding, generation, and instruction following","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.17695","last_updated":"2025-04-24T16:03:11Z","snapshot_observed_at":"2026-08-18T09:45:47.315458Z","submitted_at":"2025-04-24T16:03:11Z","title":"PICO: Reconstructing 3D People In Contact with Objects","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T10:39:54.386245Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2504.17695"},"observation_digest":"sha256:c6d0d802cf9dc4ba996a3e86a547ef583cd40548d91492ef0822ed959282c063","observation_id":"4c30594e-b689-472e-bb37-e0bffc51e018","resolution":{"observed_at":"2026-08-16T10:39:54.386245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-16T05:58:27.435522Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understand- ing, generation, and instruction following.arXiv preprint arXiv:2309.00615, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.435522Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:46cb6c021c756d6aca36eb58a22a466ae07e53568d303acf96f7ec44ffbd56cd","observation_id":"582c9234-5cd1-4879-b6e5-f2e013dbc122","resolution":{"observed_at":"2026-08-16T05:58:27.435522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":"2309.00615","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-07-04T03:09:29.321784Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":"99ba2617-dd10-4f2d-bb63-cc88e743aa78","year":2023},"citing_paper":{"arxiv_id":"2505.17674","last_updated":"2026-08-04T17:10:18Z","snapshot_observed_at":"2026-08-18T16:21:02.282898Z","submitted_at":"2025-05-23T09:41:10Z","title":"SVL: Empowering Spiking Neural Networks for Efficient 3D Open-World Understanding","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-22T02:12:29.058875Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2505.17674"},"observation_digest":"sha256:1427aeec2ce0eddf6a8d3c56248b3cd82bd77dacf40717b1677a2ef945ec45d1","observation_id":"fb9951c6-01da-41c6-b870-43e634eac887","resolution":{"observed_at":"2026-05-22T02:14:31.402477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-07T13:46:13.736700Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-15T10:22:51.546118Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:13.736700Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:3ed6d693adbcdc3f3803561ea3527422efaa743905422d15119db649876f18fc","observation_id":"1fb51303-b186-4311-81fd-ed0387cc064f","resolution":{"observed_at":"2026-08-07T13:46:13.736700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-07T10:25:44.471372Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following.arXiv preprint arXiv:2309.00615, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:44.471372Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:65ae86f348f9dcecd390cccaa61ab62240905622e9b39c5f51739965ca23f9f8","observation_id":"6dcc3e57-1339-43a5-89b4-aa16ea337daa","resolution":{"observed_at":"2026-08-07T10:25:44.471372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-07T10:28:48.831388Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following.arXiv preprint arXiv:2309.00615, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05331","last_updated":"2025-06-05T17:59:02Z","snapshot_observed_at":"2026-08-16T07:14:23.993847Z","submitted_at":"2025-06-05T17:59:02Z","title":"MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:48.831388Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2506.05331"},"observation_digest":"sha256:8fa63ab9bc2eae7b7164b26456355f9ff6cbaea808fbf4eb659ebfdfb15cee06","observation_id":"a0b0bc7b-2015-4230-ba85-88eeb169b2dd","resolution":{"observed_at":"2026-08-07T10:28:48.831388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-07T13:50:49.128007Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understand- ing, generation, and instruction following.arXiv preprint arXiv:2309.00615, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08023","last_updated":"2025-05-27T08:13:08Z","snapshot_observed_at":"2026-08-15T23:29:25.862015Z","submitted_at":"2025-05-27T08:13:08Z","title":"Aligning Proteins and Language: A Foundation Model for Protein Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:50:49.128007Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2506.08023"},"observation_digest":"sha256:20d2e8d851fd3a36277e62bc51717f759e2fdbec46f03e735190aee845c52c70","observation_id":"8c99c45f-392a-4f2b-81e0-ccb75022e912","resolution":{"observed_at":"2026-08-07T13:50:49.128007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-06T23:34:51.681819Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-14T11:29:07.568580Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:51.681819Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:adeba55594b7cad346271753a7182011d81c3407be6d5778c3a16df81ff720eb","observation_id":"b9d52e38-0094-444f-aa1f-65c4f97ce632","resolution":{"observed_at":"2026-08-06T23:34:51.681819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-06T21:52:59.369243Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understand- ing, generation, and instruction following","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:59.369243Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:76f589cbbb22122bf024af56f1da6a2d962539ae8e787afe9cfe32fe5b364c0c","observation_id":"44a72786-e440-4241-b3d0-a9436f35572d","resolution":{"observed_at":"2026-08-06T21:52:59.369243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-06T18:02:59.359288Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-15T18:44:58.192236Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:59.359288Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:565d9fbf2b6fdc68dd1b96bd445f052ae489863f2520615947fbe0560860382a","observation_id":"18c0dbd6-b05f-4c15-a4df-c38a6f616566","resolution":{"observed_at":"2026-08-06T18:02:59.359288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-06T16:42:13.251847Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12916","last_updated":"2025-07-17T09:02:04Z","snapshot_observed_at":"2026-08-17T09:54:48.802796Z","submitted_at":"2025-07-17T09:02:04Z","title":"Argus: Leveraging Multiview Images for Improved 3-D Scene Understanding With Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:42:13.251847Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2507.12916"},"observation_digest":"sha256:69a03401af91e20309761a9f3fb869f37501161ef17db46d553bf4068935f530","observation_id":"09301636-1c60-43b7-806a-0de568cf3f9b","resolution":{"observed_at":"2026-08-06T16:42:13.251847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-06T13:48:02.658757Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-16T20:17:10.571287Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:02.658757Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:15a022657de064b3c6357f9210cad170cd033ae0a607f850b3e18b1e2ebeebc9","observation_id":"cb278c4f-bce7-469a-87bf-a312ab79e322","resolution":{"observed_at":"2026-08-06T13:48:02.658757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-06T05:45:38.656582Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understand- ing, generation, and instruction following","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01240","last_updated":"2025-08-02T07:25:23Z","snapshot_observed_at":"2026-08-17T00:23:25.107839Z","submitted_at":"2025-08-02T07:25:23Z","title":"RelMap: Reliable Spatiotemporal Sensor Data Visualization via Imputative Spatial Interpolation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T05:45:38.656582Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2508.01240"},"observation_digest":"sha256:6f7c9c5401492a7084cf464374230f5ba9da4f3e1234a169106b625ff500c6ba","observation_id":"024d5114-7247-4ace-a7d7-45e71e900995","resolution":{"observed_at":"2026-08-06T05:45:38.656582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-06T05:46:02.903719Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01242","last_updated":"2025-08-05T05:55:00Z","snapshot_observed_at":"2026-08-15T12:32:39.627023Z","submitted_at":"2025-08-02T07:37:37Z","title":"MeshLLM: Empowering Large Language Models to Progressively Understand and Generate 3D Mesh","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T05:46:02.903719Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2508.01242"},"observation_digest":"sha256:b37867badd70d59f597857f9f23558ece595b063d0e2726179490ab5628bd679","observation_id":"d63d3400-c36f-4480-b124-c841d9bcdf57","resolution":{"observed_at":"2026-08-06T05:46:02.903719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-05T21:53:38.546874Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07759","last_updated":"2025-08-11T08:42:49Z","snapshot_observed_at":"2026-08-19T21:05:20.252140Z","submitted_at":"2025-08-11T08:42:49Z","title":"Correspondence as Video: Test-Time Adaption on SAM2 for Reference Segmentation in the Wild","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T21:53:38.546874Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2508.07759"},"observation_digest":"sha256:51b1d1f458314cec37bcba4c8f24ff8ebc9a7f8d253a8124e22f817f874fb097","observation_id":"5d699655-fa0b-4b15-8b7d-d26d123166e9","resolution":{"observed_at":"2026-08-05T21:53:38.546874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-15T17:07:09.736041Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understand- ing, generation, and instruction following","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17595","last_updated":"2025-08-25T01:36:22Z","snapshot_observed_at":"2026-08-18T11:11:21.833666Z","submitted_at":"2025-08-25T01:36:22Z","title":"TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T17:07:09.736041Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2508.17595"},"observation_digest":"sha256:a0d89aa893f8a0a1143fde451645c295ad2cbf77f682232544f6ac3ca0972465","observation_id":"5f32692a-f101-4fee-a90b-a1b6bcbbc49b","resolution":{"observed_at":"2026-08-15T17:07:09.736041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":"2309.00615","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-07-04T03:09:29.321784Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":"99ba2617-dd10-4f2d-bb63-cc88e743aa78","year":2023},"citing_paper":{"arxiv_id":"2511.12034","last_updated":"2026-05-12T07:28:48Z","snapshot_observed_at":"2026-08-15T05:27:02.912444Z","submitted_at":"2025-11-15T05:01:43Z","title":"Calibrated Multimodal Representation Learning with Missing Modalities","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-17T22:08:07.217659Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2511.12034"},"observation_digest":"sha256:387e1383c6cfae981c8c94cc44e19d42e194612898dbaf3d3659e1a26d723537","observation_id":"84f5614f-93ca-4b8c-8136-58b77355c6a4","resolution":{"observed_at":"2026-05-17T22:10:22.660828Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-03T12:50:01.034749Z","title":"Point-bind & point- llm: Aligning point cloud with multi-modality for 3d under- standing, generation, and instruction following.arXiv preprint arXiv:2309.00615,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.01456","last_updated":"2026-05-29T09:27:43Z","snapshot_observed_at":"2026-08-18T11:08:50.455978Z","submitted_at":"2026-01-04T09:53:49Z","title":"Rethinking Multimodal Few-Shot 3D Point Cloud Segmentation: From Fused Refinement to Decoupled Arbitration","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:01.034749Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2601.01456"},"observation_digest":"sha256:dbfa5cef7c0efac7c78172f35119ea419139d02861c4f357a4621a608acd55c6","observation_id":"e61121aa-809c-44e4-a755-e5b43e9b7d83","resolution":{"observed_at":"2026-08-03T12:50:01.034749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":"2309.00615","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-07-04T03:09:29.321784Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":"99ba2617-dd10-4f2d-bb63-cc88e743aa78","year":2023},"citing_paper":{"arxiv_id":"2603.10963","last_updated":"2026-03-11T16:50:46Z","snapshot_observed_at":"2026-08-15T01:42:19.136782Z","submitted_at":"2026-03-11T16:50:46Z","title":"Pointy - A Lightweight Transformer for Point Cloud Foundation Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T13:28:23.934522Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2603.10963"},"observation_digest":"sha256:fd9631230186a37609a3a7abf0926286b14800e59abe1ad8c8fa929135eb7bb3","observation_id":"26024ed0-c9be-4d31-be8a-7c3e922ab0e1","resolution":{"observed_at":"2026-05-15T13:30:01.609235Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":"2309.00615","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-07-04T03:09:29.321784Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":"99ba2617-dd10-4f2d-bb63-cc88e743aa78","year":2023},"citing_paper":{"arxiv_id":"2603.17980","last_updated":"2026-05-07T05:29:31Z","snapshot_observed_at":"2026-08-14T09:51:49.331073Z","submitted_at":"2026-03-18T17:42:49Z","title":"Feeling the Space: Egomotion-Aware Video Representation for Efficient and Accurate 3D Scene Understanding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T09:30:03.668178Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2603.17980"},"observation_digest":"sha256:e27b9264b1749ba94a69e190644c25072cdd274230b2c477df4bf29665dd9096","observation_id":"860ced58-9fcd-4dd9-a5c6-08df71a734a3","resolution":{"observed_at":"2026-05-15T09:30:22.462415Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-02T17:54:04.904102Z","title":"arXiv preprint arXiv:2309.00615 (2023) 2, 4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.19235","last_updated":"2026-07-17T06:42:00Z","snapshot_observed_at":"2026-08-14T02:16:35.171898Z","submitted_at":"2026-03-19T17:59:58Z","title":"Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T17:54:04.904102Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2603.19235"},"observation_digest":"sha256:4aeb1bca33098be374ec1cc86d0dbc9b1f7c2610546a8cc04beea63876dd58b8","observation_id":"fc0d30ca-9ace-47ee-aae3-8a25e85ce2a6","resolution":{"observed_at":"2026-08-02T17:54:04.904102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":"2309.00615","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-07-04T03:09:29.321784Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":"99ba2617-dd10-4f2d-bb63-cc88e743aa78","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-08-10T23:52:35.908557Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:7d03b93205fb5bfc5c38778237c0c621073fe433dac892b366ca8f82f5d052d3","observation_id":"2a95df81-557a-4628-91a3-784c68deacc3","resolution":{"observed_at":"2026-05-14T21:32:59.409437Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":"2309.00615","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-07-04T03:09:29.321784Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":"99ba2617-dd10-4f2d-bb63-cc88e743aa78","year":2023},"citing_paper":{"arxiv_id":"2604.02546","last_updated":"2026-07-02T01:57:06Z","snapshot_observed_at":"2026-08-16T15:07:07.050738Z","submitted_at":"2026-04-02T21:54:43Z","title":"RGB-Pointmap Pretraining for Unified 3D Scene Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T21:19:49.421653Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2604.02546"},"observation_digest":"sha256:736e81f02233a629245e0eba96dab9f57319cc31f5b511186d40f8d06b7a1a9b","observation_id":"5ec2897e-d7c3-4518-a28f-f3a1f3b05512","resolution":{"observed_at":"2026-05-13T21:23:17.900121Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":"2309.00615","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-07-04T03:09:29.321784Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":"99ba2617-dd10-4f2d-bb63-cc88e743aa78","year":2023},"citing_paper":{"arxiv_id":"2604.02689","last_updated":"2026-04-03T03:32:55Z","snapshot_observed_at":"2026-08-15T05:07:17.183164Z","submitted_at":"2026-04-03T03:32:55Z","title":"Efficient3D: A Unified Framework for Adaptive and Debiased Token Reduction in 3D MLLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T19:45:33.950587Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2604.02689"},"observation_digest":"sha256:e12e7288d1bbddfcbfdf2d0c87c62bb9c45415b14a0a809a57cb65b6cc1fbb6f","observation_id":"8ad60e09-435a-4793-aa0d-2884ed868abf","resolution":{"observed_at":"2026-05-13T19:48:11.404582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":"2309.00615","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-07-04T03:09:29.321784Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":"99ba2617-dd10-4f2d-bb63-cc88e743aa78","year":2023},"citing_paper":{"arxiv_id":"2604.07763","last_updated":"2026-04-09T03:35:21Z","snapshot_observed_at":"2026-08-11T14:35:46.762970Z","submitted_at":"2026-04-09T03:35:21Z","title":"Beyond Surface Artifacts: Capturing Shared Latent Forgery Knowledge Across Modalities","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T18:06:06.896112Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2604.07763"},"observation_digest":"sha256:e4f4ab263e940345faadbb55a8260fa34878fc1ea829de3edf8442a54167dd76","observation_id":"bb3797ac-0573-40bb-893f-d23c12f67e7d","resolution":{"observed_at":"2026-05-11T05:30:59.344899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":"2309.00615","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-07-04T03:09:29.321784Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":"99ba2617-dd10-4f2d-bb63-cc88e743aa78","year":2023},"citing_paper":{"arxiv_id":"2604.21160","last_updated":"2026-04-23T00:01:40Z","snapshot_observed_at":"2026-08-13T08:08:51.941239Z","submitted_at":"2026-04-23T00:01:40Z","title":"Reinforcing 3D Understanding in Point-VLMs via Geometric Reward Credit Assignment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-09T23:00:14.031709Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2604.21160"},"observation_digest":"sha256:45b0bc5c9509b6b6b9189c3b31062c61f82cf60bbc715f65a7b846a9bfbb4750","observation_id":"22b41bc1-497c-41a9-90d5-cfed256071a6","resolution":{"observed_at":"2026-05-09T23:04:18.054828Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":"2309.00615","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-07-04T03:09:29.321784Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":"99ba2617-dd10-4f2d-bb63-cc88e743aa78","year":2023},"citing_paper":{"arxiv_id":"2605.18039","last_updated":"2026-05-18T08:31:04Z","snapshot_observed_at":"2026-08-15T01:08:18.336672Z","submitted_at":"2026-05-18T08:31:04Z","title":"SGSoft: Learning Fused Semantic-Geometric Features for 3D Shape Correspondence via Template-Guided Soft Signals","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T11:48:55.446684Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2605.18039"},"observation_digest":"sha256:34a15707d86f693e65f2e68b1718b268fd38304c29f6f4924a86821694a90898","observation_id":"41006236-384f-48d0-967e-987897c84767","resolution":{"observed_at":"2026-05-20T11:53:15.141947Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":"2309.00615","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-07-04T03:09:29.321784Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":"99ba2617-dd10-4f2d-bb63-cc88e743aa78","year":2023},"citing_paper":{"arxiv_id":"2606.17888","last_updated":"2026-06-16T13:09:32Z","snapshot_observed_at":"2026-08-08T01:57:17.698279Z","submitted_at":"2026-06-16T13:09:32Z","title":"MathVis-Fine: Aligning Visual Supervision with Necessity via Progressive Dependency-Guided Training for Multimodal Mathematical Reasoning","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-06-27T01:23:40.564561Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2606.17888"},"observation_digest":"sha256:71e4fc07556c53466521322e1ffcdff101ee32e9fe0b4bbfcc02ceba7253bc41","observation_id":"bb6a6b9a-3818-4e0a-a863-38a7bfce053d","resolution":{"observed_at":"2026-07-03T20:18:57.763666Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":"2309.00615","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-07-04T03:09:29.321784Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":"99ba2617-dd10-4f2d-bb63-cc88e743aa78","year":2023},"citing_paper":{"arxiv_id":"2606.19776","last_updated":"2026-06-18T04:24:28Z","snapshot_observed_at":"2026-08-15T05:52:24.224799Z","submitted_at":"2026-06-18T04:24:28Z","title":"Occ-VLM: Occupancy Grounded Vision Language Model for Indoor Scene Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T18:40:20.588652Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2606.19776"},"observation_digest":"sha256:ecb3f1ea71d5224e9fe548e5e231479ed4c9f210cb0dc51edda94ee55a189caf","observation_id":"e7e808af-abb6-456d-a443-0ebefd3e80f8","resolution":{"observed_at":"2026-07-04T02:59:25.799065Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":"2309.00615","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-07-04T03:09:29.321784Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":"99ba2617-dd10-4f2d-bb63-cc88e743aa78","year":2023},"citing_paper":{"arxiv_id":"2606.19828","last_updated":"2026-06-18T06:12:59Z","snapshot_observed_at":"2026-08-14T06:40:13.192954Z","submitted_at":"2026-06-18T06:12:59Z","title":"3D-PLOT-LLM: Part-Level Object Tokens for 3D Large Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-26T18:25:55.011125Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2606.19828"},"observation_digest":"sha256:17c7edc08f80e0bb2ee6df8a1dfdc3826a5943871e9afcf3ca322926592b8ab1","observation_id":"083afcaf-f843-4667-976e-a20b19ff9d03","resolution":{"observed_at":"2026-07-04T03:09:29.323841Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":"2309.00615","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-07-04T03:09:29.321784Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":"99ba2617-dd10-4f2d-bb63-cc88e743aa78","year":2023},"citing_paper":{"arxiv_id":"2606.31533","last_updated":"2026-07-23T15:06:35Z","snapshot_observed_at":"2026-08-12T22:21:45.752129Z","submitted_at":"2026-06-30T11:46:25Z","title":"MV-GEL: Language-Driven Multi-View Geometric Entity Localization on Meshes","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-01T05:56:47.849311Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2606.31533"},"observation_digest":"sha256:69c92658af2c160093a1656b8670862046f237bca25a2ea69693a5b8aac48482","observation_id":"cc7bc106-3e0b-4cde-94ca-d2f97f99e77a","resolution":{"observed_at":"2026-07-01T10:05:40.451224Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-02T09:23:10.452175Z","title":"arXiv preprint arXiv:2309.00615 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.31533","last_updated":"2026-07-23T15:06:35Z","snapshot_observed_at":"2026-08-12T22:21:45.752129Z","submitted_at":"2026-06-30T11:46:25Z","title":"MV-GEL: Language-Driven Multi-View Geometric Entity Localization on Meshes","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T09:23:10.452175Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2606.31533"},"observation_digest":"sha256:28bff69ac121271878fbd97ae16507035a34afccc2cfbdecaedc884543ecd2fe","observation_id":"85be3b90-7c38-49e4-8bab-740661559d48","resolution":{"observed_at":"2026-08-02T09:23:10.452175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":"2309.00615","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-07-04T03:09:29.321784Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":"99ba2617-dd10-4f2d-bb63-cc88e743aa78","year":2023},"citing_paper":{"arxiv_id":"2607.01784","last_updated":"2026-07-02T06:56:29Z","snapshot_observed_at":"2026-08-20T02:59:38.127661Z","submitted_at":"2026-07-02T06:56:29Z","title":"SpaceEra++: A Unified Framework Towards 3D Spatial Reasoning in Video","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-03T16:16:41.412451Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2607.01784"},"observation_digest":"sha256:00eba586c9c7143b7e4c66646a982800fc67d2bc9c17d4d5696e67139f51cc0b","observation_id":"d1acf887-f64c-4ed8-a250-ec3305992d20","resolution":{"observed_at":"2026-07-03T16:18:37.260308Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-02T06:23:28.101393Z","title":"Point-Bind & Point-","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12752","last_updated":"2026-07-15T04:28:35Z","snapshot_observed_at":"2026-08-13T15:22:31.143206Z","submitted_at":"2026-07-14T13:19:06Z","title":"Hallo4D: Multi-Modal Hallucination Mitigation for Consistent Spatio-Temporal Generation","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-02T06:23:28.101393Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2607.12752"},"observation_digest":"sha256:41136f7e733474f02f6b4002871fb4e4bcbf0d83def534ca45666ccec10aedaa","observation_id":"131fa64a-d148-48f8-88e0-f269398cb505","resolution":{"observed_at":"2026-08-02T06:23:28.101393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-02T00:23:01.446109Z","title":"Point-bind & point-llm: Aligning point cloud with multi- modality for 3d understanding, generation, and instruction following.arXiv preprint arXiv:2309.00615,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-20T22:14:11.739492Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:01.446109Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:3ba38ff8f26480a56c12966e2aa19fc98d69ded48d8e4170836d3fcdbe7d5986","observation_id":"4ba8b9c3-c4ab-43e9-9f7c-f875897ca14e","resolution":{"observed_at":"2026-08-02T00:23:01.446109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-06T04:28:21.948953Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05137","last_updated":"2026-08-10T14:28:23Z","snapshot_observed_at":"2026-08-14T22:57:36.738574Z","submitted_at":"2026-08-05T17:56:35Z","title":"SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T04:28:21.948953Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2608.05137"},"observation_digest":"sha256:c344405bf916a3273018a773ea7829c178b99d0800cf514d579671fb027b7d19","observation_id":"4cac77ab-1356-46cc-99b1-f15769faffd5","resolution":{"observed_at":"2026-08-06T04:28:21.948953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-10T04:30:40.838444Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05137","last_updated":"2026-08-10T14:28:23Z","snapshot_observed_at":"2026-08-14T22:57:36.738574Z","submitted_at":"2026-08-05T17:56:35Z","title":"SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T04:30:40.838444Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2608.05137"},"observation_digest":"sha256:414317f3ed3ae98cf2caf499c6d8466745cd1b7cab05dd78cf665942efcd2af3","observation_id":"af998083-3948-4289-a462-9bf20c369917","resolution":{"observed_at":"2026-08-10T04:30:40.838444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-11T04:18:06.824915Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05137","last_updated":"2026-08-10T14:28:23Z","snapshot_observed_at":"2026-08-14T22:57:36.738574Z","submitted_at":"2026-08-05T17:56:35Z","title":"SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:06.824915Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2608.05137"},"observation_digest":"sha256:74086e397aa7569d86667bc9ded7f87644b5894117081cf573155821fbab03cf","observation_id":"9f9aacc4-5617-4525-b65e-333599fa3935","resolution":{"observed_at":"2026-08-11T04:18:06.824915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2309.00615/citation-record","integrity":"/paper/2309.00615/integrity","json":"/paper/2309.00615/citation-record.json","paper":"/paper/2309.00615"},"outbound":[],"paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 59 inbound Pith citation observations for arXiv:2309.00615."}