{"as_of":"2026-08-18T13:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bbe06dab618bb5e3916ebe345fa29158cf6818269e2fad45f657c879603a5ffb","coverage":[{"denominator":7,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:13:25.257063Z","state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:34:07.995899Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-16T12:16:17.039197Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.18738","last_updated":"2025-04-25T23:27:26Z","snapshot_observed_at":"2026-08-16T10:08:15.848040Z","submitted_at":"2025-04-25T23:27:26Z","title":"A Review of 3D Object Detection with Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.18738","doi":"10.48550/arxiv.2504.18738","metadata_source":"pith","pith_arxiv_id":"2504.18738","snapshot_observed_at":"2026-08-16T12:16:17.039197Z","title":"A Review of 3D Object Detection with Vision-Language Models","venue":"cs.CV","work_id":"3188dcd0-b557-447e-bcdc-b3d66f8c2640","year":2025},"citing_paper":{"arxiv_id":"2504.20419","last_updated":"2025-04-29T04:31:58Z","snapshot_observed_at":"2026-08-17T00:39:23.013069Z","submitted_at":"2025-04-29T04:31:58Z","title":"Plant Disease Detection through Multimodal Large Language Models and Convolutional Neural Networks","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-16T05:34:07.995899Z"},"links":{"cited_paper":"/paper/2504.18738","citing_paper":"/paper/2504.20419"},"observation_digest":"sha256:2641b1b30c6d459e14d40298c5c1492af227eeeaa77fc48057a9ff6ce01df948","observation_id":"f52befdf-3477-40ff-8c9b-f9d2922e3eb1","resolution":{"observed_at":"2026-08-16T05:34:08.064561Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.18738/citation-record","integrity":"/paper/2504.18738/integrity","json":"/paper/2504.18738/citation-record.json","paper":"/paper/2504.18738"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.17851","last_updated":"2024-06-17T17:27:19Z","snapshot_observed_at":"2026-08-18T09:56:21.164635Z","submitted_at":"2023-11-29T17:54:22Z","title":"Leveraging VLM-Based Pipelines to Annotate 3D Objects","version":2},"cited_work":{"arxiv_id":"2311.17851","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.17851","snapshot_observed_at":"2026-08-16T10:13:25.729570Z","title":"Leveraging VLM-Based Pipelines to Annotate 3D Objects","venue":"cs.CV","work_id":"4312fdc6-1269-408b-9fbe-6b04eda00ba7","year":2023},"citing_paper":{"arxiv_id":"2504.18738","last_updated":"2025-04-25T23:27:26Z","snapshot_observed_at":"2026-08-16T10:08:15.848040Z","submitted_at":"2025-04-25T23:27:26Z","title":"A Review of 3D Object Detection with Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:25.139862Z"},"links":{"cited_paper":"/paper/2311.17851","citing_paper":"/paper/2504.18738"},"observation_digest":"sha256:9eebb3ad80fcf4b71ba24d6bafaa985e071c63b4e17527f344e8c18e58299998","observation_id":"98957a5e-5342-4994-8ea7-0436f0597901","resolution":{"observed_at":"2026-08-16T10:13:25.741575Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08092","last_updated":"2025-03-11T06:52:25Z","snapshot_observed_at":"2026-08-18T02:37:38.022579Z","submitted_at":"2025-03-11T06:52:25Z","title":"SparseVoxFormer: Sparse Voxel-based Transformer for Multi-modal 3D Object Detection","version":1},"cited_work":{"arxiv_id":"2503.08092","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.08092","snapshot_observed_at":"2026-08-16T10:13:25.617968Z","title":"SparseVoxFormer: Sparse Voxel-based Transformer for Multi-modal 3D Object Detection","venue":"cs.CV","work_id":"79a0205b-6c26-4109-ba0b-5e1724f776bf","year":2025},"citing_paper":{"arxiv_id":"2504.18738","last_updated":"2025-04-25T23:27:26Z","snapshot_observed_at":"2026-08-16T10:08:15.848040Z","submitted_at":"2025-04-25T23:27:26Z","title":"A Review of 3D Object Detection with Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:25.173316Z"},"links":{"cited_paper":"/paper/2503.08092","citing_paper":"/paper/2504.18738"},"observation_digest":"sha256:b98b8297c9bc2e1ebde8cb892089c1290d48a3fe2ec329a314b8f2e06769c740","observation_id":"33ac26f8-7c1c-4483-ba56-11a9eb3bf281","resolution":{"observed_at":"2026-08-16T10:13:25.627225Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13175","last_updated":"2025-02-25T12:49:59Z","snapshot_observed_at":"2026-08-17T18:15:22.113753Z","submitted_at":"2025-02-18T03:38:07Z","title":"Towards Robust and Secure Embodied AI: A Survey on Vulnerabilities and Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13175","snapshot_observed_at":"2026-08-16T10:13:25.257063Z","title":"Computers & Graphics 119 (2024), 103885","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18738","last_updated":"2025-04-25T23:27:26Z","snapshot_observed_at":"2026-08-16T10:08:15.848040Z","submitted_at":"2025-04-25T23:27:26Z","title":"A Review of 3D Object Detection with Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:25.257063Z"},"links":{"cited_paper":"/paper/2502.13175","citing_paper":"/paper/2504.18738"},"observation_digest":"sha256:619fa62c9862f15e06e5bee76120d8185afd12133705385b8c83fbad44c3828d","observation_id":"7018c0b3-d611-47e9-8421-b7f103a98985","resolution":{"observed_at":"2026-08-16T10:13:25.257063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11475","last_updated":"2026-07-20T02:07:28Z","snapshot_observed_at":"2026-08-18T03:02:30.383382Z","submitted_at":"2024-12-16T06:38:00Z","title":"OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference","version":3},"cited_work":{"arxiv_id":"2412.11475","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.11475","snapshot_observed_at":"2026-08-16T10:13:25.893446Z","title":"OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference","venue":"cs.CV","work_id":"987c82f0-9d55-43aa-92e9-d0ca380c6140","year":2024},"citing_paper":{"arxiv_id":"2504.18738","last_updated":"2025-04-25T23:27:26Z","snapshot_observed_at":"2026-08-16T10:08:15.848040Z","submitted_at":"2025-04-25T23:27:26Z","title":"A Review of 3D Object Detection with Vision-Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:25.113330Z"},"links":{"cited_paper":"/paper/2412.11475","citing_paper":"/paper/2504.18738"},"observation_digest":"sha256:fa435af9bfdd560b4ef178cc7b38c75469cc6a42c2d31111fbe51a13fe503f5b","observation_id":"8febbffd-7988-46e7-b6ce-d4a41c792e9f","resolution":{"observed_at":"2026-08-16T10:13:26.010057Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15780","last_updated":"2023-03-28T07:50:45Z","snapshot_observed_at":"2026-08-16T21:26:31.535428Z","submitted_at":"2023-03-28T07:50:45Z","title":"Instruct 3D-to-3D: Text Instruction Guided 3D-to-3D conversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15780","snapshot_observed_at":"2026-08-16T10:13:25.147697Z","title":"arXiv preprint arXiv:2303.15780 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18738","last_updated":"2025-04-25T23:27:26Z","snapshot_observed_at":"2026-08-16T10:08:15.848040Z","submitted_at":"2025-04-25T23:27:26Z","title":"A Review of 3D Object Detection with Vision-Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:25.147697Z"},"links":{"cited_paper":"/paper/2303.15780","citing_paper":"/paper/2504.18738"},"observation_digest":"sha256:d6d621d4720ed8129e3e9bc3d1ad71c612a20bb826aa8c942cce9de5ae902591","observation_id":"f2f5b1d2-5aff-40db-a7c9-fc4a66b70aa8","resolution":{"observed_at":"2026-08-16T10:13:25.147697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-16T14:04:54.843248Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-16T10:13:25.100455Z","title":"In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.18738","last_updated":"2025-04-25T23:27:26Z","snapshot_observed_at":"2026-08-16T10:08:15.848040Z","submitted_at":"2025-04-25T23:27:26Z","title":"A Review of 3D Object Detection with Vision-Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:25.100455Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2504.18738"},"observation_digest":"sha256:eb89adca9e26117edf6e64b1101b1af3ba658df2a8a4e62f5e03102ad80d233c","observation_id":"0abec588-bf00-4e50-ae31-19e61f2e006e","resolution":{"observed_at":"2026-08-16T10:13:25.100455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06435","last_updated":"2025-03-09T04:22:08Z","snapshot_observed_at":"2026-08-18T02:04:38.814077Z","submitted_at":"2025-03-09T04:22:08Z","title":"OV-SCAN: Semantically Consistent Alignment for Novel Object Discovery in Open-Vocabulary 3D Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06435","snapshot_observed_at":"2026-08-16T10:13:25.128583Z","title":"arXiv preprint arXiv:2503.06435 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.18738","last_updated":"2025-04-25T23:27:26Z","snapshot_observed_at":"2026-08-16T10:08:15.848040Z","submitted_at":"2025-04-25T23:27:26Z","title":"A Review of 3D Object Detection with Vision-Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:25.128583Z"},"links":{"cited_paper":"/paper/2503.06435","citing_paper":"/paper/2504.18738"},"observation_digest":"sha256:f196d11978614f452843f2dae3ddb824e0d7646cf3b76323ed25239b10f65f22","observation_id":"ba40995c-8a85-4c7d-bded-77e27378dee3","resolution":{"observed_at":"2026-08-16T10:13:25.128583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.18738","last_updated":"2025-04-25T23:27:26Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T10:08:15.848040Z","submitted_at":"2025-04-25T23:27:26Z","title":"A Review of 3D Object Detection with Vision-Language Models"},"reference_resolution":{"displayed":7,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":7},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 7 of 7 outbound references and 1 inbound Pith citation observation for arXiv:2504.18738."}