{"as_of":"2026-08-19T07:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2cc761b68267471d1b11ce6f81bfe4e8021cde38722bce66ef7ee85b55711669","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:34:09.063740Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.12693/citation-record","integrity":"/paper/2505.12693/integrity","json":"/paper/2505.12693/citation-record.json","paper":"/paper/2505.12693"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.15676","last_updated":"2026-06-01T14:59:35Z","snapshot_observed_at":"2026-08-16T14:49:25.586477Z","submitted_at":"2023-10-24T09:39:05Z","title":"Recent Advances in Multi-modal 3D Intelligence: A Comprehensive Survey and Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15676","snapshot_observed_at":"2026-08-15T20:34:08.960406Z","title":"Recent advances in multi- modal 3d scene understanding: A comprehensive survey and evaluation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T10:01:31.074231Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:08.960406Z"},"links":{"cited_paper":"/paper/2310.15676","citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:fefaf3b696e1659ed4f5343349be27e31d22ae2498e6f00fc4dc85bdfea96db9","observation_id":"42db11b3-c41d-4123-9353-998d1c6c9054","resolution":{"observed_at":"2026-08-15T20:34:08.960406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-08-16T21:18:10.684128Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-08-15T20:34:08.967786Z","title":"Zhiqi Li, Zhiding Yu, David Austin, Mingsheng Fang, Shiyi Lan, Jan Kautz, and Jose M Alvarez","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T10:01:31.074231Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:08.967786Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:14f74de93612939c66e1568a66fc2a3d7d65434837d4815b90fb58b17c8058ef","observation_id":"d25bf1b2-8013-47eb-871b-60bca5beac60","resolution":{"observed_at":"2026-08-15T20:34:08.967786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-15T20:34:08.974582Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T10:01:31.074231Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:08.974582Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:130caa399a49e57d2999038c1cc5da2346de9d54af169e02647bee335e65e8a1","observation_id":"e7abee49-04d6-4cc7-ad26-68d20ff73f0a","resolution":{"observed_at":"2026-08-15T20:34:08.974582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:09.332269Z","title":null,"venue":null,"work_id":"014ead89-25c8-4c47-a140-69c23e6e6d74","year":2023},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T10:01:31.074231Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:09.063740Z"},"links":{"citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:b4c30259c7c05def11c5ca997e4e7401b6ca2dc6388bef1101a10f7757addb70","observation_id":"1258a394-9e55-4df3-a823-d36c65ce4a68","resolution":{"observed_at":"2026-08-15T20:34:09.337957Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09117","last_updated":"2023-06-15T13:23:57Z","snapshot_observed_at":"2026-08-16T15:23:40.421909Z","submitted_at":"2023-06-15T13:23:57Z","title":"UniOcc: Unifying Vision-Centric 3D Occupancy Prediction with Geometric and Semantic Rendering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09117","snapshot_observed_at":"2026-08-15T20:34:09.001601Z","title":"Co-occ: Coupling explicit feature fusion with volume rendering regularization for multi-modal 3d semantic occupancy prediction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T10:01:31.074231Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:09.001601Z"},"links":{"cited_paper":"/paper/2306.09117","citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:e1a5a0402b986b7518ffd821ad35cc91ef194270971303fa797daba0f8799106","observation_id":"32e61d29-04e1-4156-9873-0e890380d664","resolution":{"observed_at":"2026-08-15T20:34:09.001601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:09.425835Z","title":"Renderocc: Vision-centric 3d occupancy prediction with 2d rendering supervision","venue":null,"work_id":"3020ee28-25f8-4263-a86b-e4ec93aa856d","year":2024},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T10:01:31.074231Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:09.013556Z"},"links":{"citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:c64edd01f73737b1e6abf2d35ca042dbb1da94849d9749f7cf95949644a91701","observation_id":"4a3e6b9c-5ca3-4302-8da7-2e49f9281f7a","resolution":{"observed_at":"2026-08-15T20:34:09.431495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:09.405182Z","title":"Occupancy anticipation for efficient explo- ration and navigation","venue":null,"work_id":"a74da948-b4d2-4117-ad19-ad945a75e389","year":2020},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T10:01:31.074231Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:09.020186Z"},"links":{"citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:7dad06c04da3c01056d59646f9c8e1ccd520dd50bcf88b06fb5a8f0eeb502533","observation_id":"5237601f-11d3-4bae-8bdd-669b6ff0838d","resolution":{"observed_at":"2026-08-15T20:34:09.411712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.03821","last_updated":"2021-01-26T08:08:02Z","snapshot_observed_at":"2026-08-18T02:39:24.718471Z","submitted_at":"2019-11-10T01:39:46Z","title":"Adaptive Fusion Techniques for Multimodal Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.03821","snapshot_observed_at":"2026-08-15T20:34:09.034485Z","title":"Dynamic fusion for multimodal data","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T10:01:31.074231Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:09.034485Z"},"links":{"cited_paper":"/paper/1911.03821","citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:83f720f0c0cde39dfc176acc6ef3593717faf1cabe24cd6127c1fbf43cf0fd4e","observation_id":"5b7a1ca3-2db0-47b2-ad7f-11eaa51d7c89","resolution":{"observed_at":"2026-08-15T20:34:09.034485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:09.369001Z","title":"Semantic segmentation-assisted scene completion for lidar point clouds","venue":null,"work_id":"583dd36d-7170-4418-b06d-b0fd0bf34f1c","year":2021},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T10:01:31.074231Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:09.041004Z"},"links":{"citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:4b5ba57c6040be389322d42a964d0d3e08e5719137b3b334521ef4456a781c10","observation_id":"711d31c2-def0-4e30-b5ed-19e875be3f74","resolution":{"observed_at":"2026-08-15T20:34:09.375495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.05662","last_updated":"2019-09-25T14:33:44Z","snapshot_observed_at":"2026-08-18T10:00:44.867682Z","submitted_at":"2019-03-13T18:23:43Z","title":"Understanding Straight-Through Estimator in Training Activation Quantized Neural Nets","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.05662","snapshot_observed_at":"2026-08-15T20:34:09.047000Z","title":"Understanding straight-through estimator in training activation quantized neural nets","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T10:01:31.074231Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:09.047000Z"},"links":{"cited_paper":"/paper/1903.05662","citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:0191436b6272d3dd7276da7f13600d1e329fa769051bf65e355fac6c82d98c7b","observation_id":"dce472bf-176e-4f93-9f82-6ff14e2c255d","resolution":{"observed_at":"2026-08-15T20:34:09.047000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02595","last_updated":"2024-07-08T06:30:01Z","snapshot_observed_at":"2026-08-16T13:55:26.942907Z","submitted_at":"2024-05-04T07:39:25Z","title":"Vision-based 3D occupancy prediction in autonomous driving: a review and outlook","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02595","snapshot_observed_at":"2026-08-15T20:34:09.058320Z","title":"Provable dynamic fusion for low-quality multimodal data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T10:01:31.074231Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:09.058320Z"},"links":{"cited_paper":"/paper/2405.02595","citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:1f9e7bdf9415e734b313cc1fb5bce1fd65c82ac9590fe54672814b4a6be8eeb2","observation_id":"0249f93b-ff51-476a-91c3-ed279fc46b8b","resolution":{"observed_at":"2026-08-15T20:34:09.058320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:09.445188Z","title":"Ssc-rs: Elevate lidar semantic scene completion with representation separation and bev fusion","venue":null,"work_id":"f3aa2e27-9dc3-47f8-a579-34a2f2c9eff9","year":2023},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T10:01:31.074231Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:08.987495Z"},"links":{"citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:7e0b63600d44e21b7a088451e9d88cb4909afeb901732fc6cfed604be58c5b3f","observation_id":"1777d019-899b-47cf-8923-ed1dc0c7a780","resolution":{"observed_at":"2026-08-15T20:34:09.450996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:09.350640Z","title":"Differentiable point-based radiance fields for efficient view synthesis","venue":null,"work_id":"aec7db7a-31c6-4083-9866-b821329dda0e","year":2022},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T10:01:31.074231Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:09.052511Z"},"links":{"citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:9e5e3c4d948eac49ceb8affa6ff9eda0ee1c4cf1f808eb381eb0d0b14e00a867","observation_id":"97e7b604-9238-4e8c-bcf3-f6b0dcac7abd","resolution":{"observed_at":"2026-08-15T20:34:09.356224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:09.387981Z","title":"Lmscnet: Lightweight multiscale 3d semantic completion","venue":null,"work_id":"d35776a5-91b3-44eb-aaf9-c06081373517","year":2020},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T10:01:31.074231Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:09.028144Z"},"links":{"citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:ebee62091516f336bb89f7eb9f1459b9d53ad5413fd2530be1181b702a756414","observation_id":"e519a811-c65e-4a3c-a614-1b5d61b297b8","resolution":{"observed_at":"2026-08-15T20:34:09.393291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04732","last_updated":"2025-04-07T05:08:22Z","snapshot_observed_at":"2026-08-16T21:17:56.572839Z","submitted_at":"2025-04-07T05:08:22Z","title":"Inverse++: Vision-Centric 3D Semantic Occupancy Prediction Assisted with 3D Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04732","snapshot_observed_at":"2026-08-15T20:34:08.994823Z","title":"Inverse++: Vision-centric 3d semantic occupancy prediction assisted with 3d object detection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T10:01:31.074231Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:08.994823Z"},"links":{"cited_paper":"/paper/2504.04732","citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:d9f2546f5f737f6336332a20f0d2ab8d45b14c90a502121fae79bed758203845","observation_id":"7ffe018c-1912-4685-9565-9ab5e10c6e93","resolution":{"observed_at":"2026-08-15T20:34:08.994823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09941","last_updated":"2025-03-13T01:35:04Z","snapshot_observed_at":"2026-08-18T12:31:48.500856Z","submitted_at":"2025-03-13T01:35:04Z","title":"TGP: Two-modal occupancy prediction with 3D Gaussian and sparse points for 3D Environment Awareness","version":1},"cited_work":{"arxiv_id":"2503.09941","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.09941","snapshot_observed_at":"2026-08-15T20:34:09.308817Z","title":"TGP: Two-modal occupancy prediction with 3D Gaussian and sparse points for 3D Environment Awareness","venue":"cs.CV","work_id":"543042f8-22e6-4f0f-a15a-a35614e795fc","year":2025},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T10:01:31.074231Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:08.945369Z"},"links":{"cited_paper":"/paper/2503.09941","citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:69525c1e1052aaa6c046136f7934e5e80ca843d97eacff85ae63ed09446851d8","observation_id":"8bf7cc18-b79e-4763-81ca-9f2ffa310c70","resolution":{"observed_at":"2026-08-15T20:34:09.316377Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01144","last_updated":"2017-08-05T22:45:19Z","snapshot_observed_at":"2026-08-15T03:05:41.956181Z","submitted_at":"2016-11-03T19:48:08Z","title":"Categorical Reparameterization with Gumbel-Softmax","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01144","snapshot_observed_at":"2026-08-15T20:34:08.953656Z","title":"Categorical reparameterization with gumbel-softmax","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T10:01:31.074231Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:08.953656Z"},"links":{"cited_paper":"/paper/1611.01144","citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:abce116fc54dff856459bcda3bcd487cbe12ccf51ef466bb65afe8609e20c8ca","observation_id":"036f5936-fb93-4798-abf1-ab8b1a4874ee","resolution":{"observed_at":"2026-08-15T20:34:08.953656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:09.462389Z","title":"Choosing smartly: Adaptive multimodal fusion for object detection in changing environments","venue":null,"work_id":"5ec22d23-dbda-4513-b333-adabd03142aa","year":2016},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T10:01:31.074231Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:08.980623Z"},"links":{"citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:7eb192cb88181842d3051db89177a606483ff155804ecaf6242ccae5c3de7b52","observation_id":"614b3aa5-b679-4dc6-9cad-1fe3bed072ab","resolution":{"observed_at":"2026-08-15T20:34:09.467719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T10:01:31.074231Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":1,"verified_fuzzy":7},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 0 inbound Pith citation observations for arXiv:2505.12693."}