{"as_of":"2026-08-22T20:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a4635d0bf62fa27d07b7ed2bf664b11622c5920c03536e8cc04f9c0534741ef1","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:33:45.234194Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.12576/citation-record","integrity":"/paper/2504.12576/integrity","json":"/paper/2504.12576/citation-record.json","paper":"/paper/2504.12576"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:46.154887Z","title":"Multimae: Multi-modal multi-task masked autoen- coders","venue":null,"work_id":"b0f7afd6-8220-4239-bd8a-13671b42060a","year":2022},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:44.920575Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:6e98f3364c45e55ee840c76323f783d247ff08b816073c8b0ee42c5d09f423ed","observation_id":"8ba16635-3d8c-4301-b6a1-6f41a79519c6","resolution":{"observed_at":"2026-08-16T12:33:46.159804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:46.140182Z","title":"Beit: Bert pre-training of image transformers","venue":null,"work_id":"a3a927f9-ab36-458d-8452-7f3b4d0e5801","year":2022},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:44.925773Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:14b0658628c1a1294e8d745e3723358b89c28645245be7b206c08ad9337d5390","observation_id":"5703e613-8c86-4795-86d5-1de470fba762","resolution":{"observed_at":"2026-08-16T12:33:46.144879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05095","last_updated":"2021-06-09T14:48:13Z","snapshot_observed_at":"2026-08-16T18:46:40.012139Z","submitted_at":"2021-02-09T19:49:33Z","title":"Is Space-Time Attention All You Need for Video Understanding?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05095","snapshot_observed_at":"2026-08-16T12:33:44.930487Z","title":"Is space-time attention all you need for video understanding? arXiv preprint arXiv:2102.05095, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:44.930487Z"},"links":{"cited_paper":"/paper/2102.05095","citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:f3b1702318ec672d210f508c64a9b382ffe90515816044ac80128a112e224a38","observation_id":"df0011cb-5772-4953-90df-ea39ecaf7b04","resolution":{"observed_at":"2026-08-16T12:33:44.930487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-14T19:47:04.330126Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-16T12:33:44.935504Z","title":"Deepseek llm: Scaling open- source language models with longtermism","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:44.935504Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:eb40457584d4aaeb2dcd311c785d6172b477724d879d73f3049060af245c95b5","observation_id":"a40b3fa2-2778-4886-8096-0e6779e508ee","resolution":{"observed_at":"2026-08-16T12:33:44.935504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:44.940844Z","title":"Lan- guage models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:44.940844Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:7e6bdc05c731670e4d4ac0ca55f2ce792e98fbf713e11c7f77ece18053a1ab8c","observation_id":"9860ca14-a597-4263-b046-560ef9db0abc","resolution":{"observed_at":"2026-08-16T12:33:44.940844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:44.946536Z","title":"End-to- end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:44.946536Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:d95e8a9b09a18bff42f80babe9539676cf98590681a93b5c854865ff48323db9","observation_id":"aa93e432-08d9-44cd-b267-138a72124aeb","resolution":{"observed_at":"2026-08-16T12:33:44.946536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:46.105423Z","title":"Weakly misalignment-free adaptive feature alignment for uavs- based multimodal object detection","venue":null,"work_id":"df2832fb-9ccf-4144-b7bb-89d7a2f4ba91","year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:44.951657Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:5900e951e48627baa89f258ec94f192f3a2868ebfc2e36807dbbb506c06bd277","observation_id":"c08d217c-1bb1-4b4a-8664-9067cb276728","resolution":{"observed_at":"2026-08-16T12:33:46.110267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:46.088525Z","title":"An empirical study of training self-supervised vision transformers","venue":null,"work_id":"3495a6c0-44ee-471a-9fc3-edb68b3c0677","year":2021},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:44.956835Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:209aa0a1b06a299e5cfee2c62d5da56a50cbc7e536269eb2d381b84408b7c658","observation_id":"dfc6f7f1-7290-4ce9-ac27-f489d5702f41","resolution":{"observed_at":"2026-08-16T12:33:46.093955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:46.072462Z","title":"Segment any event streams via 11 weighted adaptation of pivotal tokens","venue":null,"work_id":"3737f023-fbb7-4d38-8ace-1f67f36981a9","year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:44.961205Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:bcdf45240a831e3a842073d4ba3f7031b7e99ac71c525111aa29a95ae55b6fa1","observation_id":"2c7e24f8-b6e3-4255-b13a-092e665e96e1","resolution":{"observed_at":"2026-08-16T12:33:46.077155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:46.056499Z","title":"Unihcp: A unified model for human-centric perceptions","venue":null,"work_id":"c3310de3-8037-4328-aa01-7055b64a8193","year":2023},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:44.965721Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:d42a418cfbe615b4c5d871a2d5da5f577893c111fcf33c8fa34d94cc2ac32382","observation_id":"3439abeb-f364-49b7-b0f9-4d799dd7798b","resolution":{"observed_at":"2026-08-16T12:33:46.061113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:46.041189Z","title":"Satmae: Pre-training transformers for tem- poral and multi-spectral satellite imagery","venue":null,"work_id":"44d842b0-3912-4586-88e2-369d87f972f3","year":2022},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:44.970391Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:70a69f91d1901e89dcf2cce36be53a16e0bb5a314b0b34f2d6487b2b50d8e049","observation_id":"38d2fb5d-d24e-432b-b290-d20ae97bc3c3","resolution":{"observed_at":"2026-08-16T12:33:46.046607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:46.026294Z","title":"Deepseekmoe: Towards ultimate expert spe- cialization in mixture-of-experts language models","venue":null,"work_id":"b6ea5e71-d00e-491e-9f2e-cf63f01550c6","year":null},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:44.974774Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:ccc2f9a25055ba58609065dd78e7cea393164fd296aa9ba30ed0b3a282e7c33d","observation_id":"98ac94c9-fdf6-4ef3-8dc5-d253015a5fa4","resolution":{"observed_at":"2026-08-16T12:33:46.030964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:46.010817Z","title":"Sfod: Spiking fusion object detector","venue":null,"work_id":"31d95d8c-6f69-4826-b3e7-574db3359a5f","year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:44.980632Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:c4d29b0ac3e48ac8b83f7f7fbbadf9969d99f04812f79ca9e72062fc522c6573","observation_id":"f59cbf1d-53eb-4070-8f65-f78cd35eb765","resolution":{"observed_at":"2026-08-16T12:33:46.015958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.995616Z","title":"Hypergraph-based multi-view action recognition using event cameras","venue":null,"work_id":"20891e98-2e79-475d-bd64-af256dc532f0","year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:44.985177Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:c6ccffb72c863cc6e6e0de768a5dbdaea3d06ef215a5109add178f057350203d","observation_id":"9980f297-1682-430c-8ef0-1241ade1e83f","resolution":{"observed_at":"2026-08-16T12:33:46.000459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14204","last_updated":"2022-10-21T04:26:27Z","snapshot_observed_at":"2026-08-19T19:38:03.699027Z","submitted_at":"2022-05-27T19:09:42Z","title":"Multimodal Masked Autoencoders Learn Transferable Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14204","snapshot_observed_at":"2026-08-16T12:33:44.989651Z","title":"Multimodal masked autoen- coders learn transferable representations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:44.989651Z"},"links":{"cited_paper":"/paper/2205.14204","citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:7d38bca2405949c80b881c9349314319ca3203f18e35b09daa21fc16fa12b602","observation_id":"de460341-6127-4e57-8104-119f7d72db4d","resolution":{"observed_at":"2026-08-16T12:33:44.989651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T12:33:44.995396Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:44.995396Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:2c062c06b64fb89c3c2d2525bbf9bbaad93df324deaf74e0b9c55fcad5599553","observation_id":"fe194490-520d-45cd-81c3-7fae7ea3d348","resolution":{"observed_at":"2026-08-16T12:33:44.995396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-16T12:33:45.000275Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.000275Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:3c5143169f0497c59dbaed18910e6a705cfc47417c24f32e036e7188417bd1fd","observation_id":"60b8eedb-36d3-441c-97e2-7c3a88c27f93","resolution":{"observed_at":"2026-08-16T12:33:45.000275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.006252Z","title":"Momentum contrast for unsupervised visual rep- resentation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.006252Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:c8df345bc2987c76e822156ae49f305937b3e4d9ee8256863e2e149501a21fc1","observation_id":"4e0369dd-4a64-4df6-b92c-11afd59e42b5","resolution":{"observed_at":"2026-08-16T12:33:45.006252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.971481Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"71e69ace-434f-4618-aca8-f5a61bbff58d","year":2022},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.011021Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:55dbbee57cff54bccc7e4edcae79b88b92d56f8a812a89c17fa603cfca1a1272","observation_id":"8bd98e9c-45d6-4423-a31f-055b5ce28c91","resolution":{"observed_at":"2026-08-16T12:33:45.976142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00416","last_updated":"2024-03-01T10:02:25Z","snapshot_observed_at":"2026-08-16T14:13:48.988445Z","submitted_at":"2024-03-01T10:02:25Z","title":"Data-efficient Event Camera Pre-training via Disentangled Masked Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00416","snapshot_observed_at":"2026-08-16T12:33:45.016104Z","title":"Data-efficient event cam- era pre-training via disentangled masked modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.016104Z"},"links":{"cited_paper":"/paper/2403.00416","citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:d92879691ffe11248ff94d576215f91480b13b11bfd0622a7961d76957b79f8e","observation_id":"034413c5-16c7-4253-b51d-d1856d61227a","resolution":{"observed_at":"2026-08-16T12:33:45.016104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.956616Z","title":"N-imagenet: Towards robust, fine-grained object recognition with event cameras","venue":null,"work_id":"d0efcf36-9bed-4d3d-8914-bcc10d2fa5b9","year":2021},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.021864Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:221932b237f5f984d6fcea33ad7b70955cc70a18b45bd6440550acd5c1b24f9a","observation_id":"ed5fa96b-ccab-45d1-8890-cdbb3cf69b19","resolution":{"observed_at":"2026-08-16T12:33:45.961258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.026355Z","title":"Spiking-yolo: spiking neural network for energy- efficient object detection","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.026355Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:80fed00b8e58cbc61ca329e2460e41187679c4ec65fe9db4f6b37b5f8d0a3ec2","observation_id":"fefa5436-bb6e-4ac9-a0fb-110eb4d3a2f5","resolution":{"observed_at":"2026-08-16T12:33:45.026355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.030964Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.030964Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:2c84bb05ad29765e88fe057ea4dce60898944a50aa0dceb1d5e5bdd2ebe65009","observation_id":"800ecb3d-ae9e-4fe9-a87e-f5854ef98554","resolution":{"observed_at":"2026-08-16T12:33:45.030964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.035526Z","title":"Masked event modeling: Self-supervised pretraining for event cameras","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.035526Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:4f80d73f033e416e53b7a950a7f45858680554700af98d17b5bac10fd4aa58c1","observation_id":"c2ff80af-8f69-4d7e-bc4b-cbc8b470212a","resolution":{"observed_at":"2026-08-16T12:33:45.035526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.913632Z","title":"Openess: Event-based semantic scene understanding with open vocabularies","venue":null,"work_id":"489b93b3-a618-49e8-b17b-543a810022ea","year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.040195Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:47ac285d48021ce8bcc7d376adf7bd6326c36a43c4bdadc2d4e2fb03d29ab73a","observation_id":"de3313fb-2b40-487a-a9d7-94727cda921c","resolution":{"observed_at":"2026-08-16T12:33:45.918387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.044826Z","title":"Mulfs-cap: Multimodal fusion- supervised cross-modality alignment perception for unreg- istered infrared-visible image fusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.044826Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:5e8c39b4df253c19ea9cce4ece51bf46b105717f89a6d808b0f86db41e45b703","observation_id":"bd9ab563-4775-4dfa-ba6b-41e4b9ad8aab","resolution":{"observed_at":"2026-08-16T12:33:45.044826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.888899Z","title":"Coupled mamba: Enhanced multimodal fusion with coupled state space model","venue":null,"work_id":"a7fb0671-9240-41dc-aff0-da13626c85d9","year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.049239Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:8e6a1543ac386169afaebf1bf8f84f9c0f0f152a00a81f0f4149b493d1ea9e96","observation_id":"e3869773-b7c9-4d8a-987f-c2c7e5b13175","resolution":{"observed_at":"2026-08-16T12:33:45.893764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.874468Z","title":"Exploring plain vision transformer backbones for object de- tection","venue":null,"work_id":"99721417-5b07-4a19-8978-a97840876257","year":2022},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.054058Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:b7f22610c84fcb56006dda0d70c9cd185e585a8b64747c59b8522b2e37fa8ff8","observation_id":"97e04996-459f-4629-879e-6143eabe9f48","resolution":{"observed_at":"2026-08-16T12:33:45.878991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-16T12:33:45.058883Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.058883Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:b2a95b83e2d71d52698c482135bf88cfec70e1b7a8ba6687990fa2ae9089b0d3","observation_id":"55f2a1b4-1763-4618-aab0-8d7753b2d2f9","resolution":{"observed_at":"2026-08-16T12:33:45.058883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.063794Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.063794Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:5f872c336ea8c42a77a22aec1a9741cb3e98dbe1fea9e212546c3c1a181bcebb","observation_id":"0309dcdf-261d-4b8a-b9b7-223f75749363","resolution":{"observed_at":"2026-08-16T12:33:45.063794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.849683Z","title":"Pixmim: Rethinking pixel reconstruction in masked image modeling","venue":null,"work_id":"1848d67f-8f2b-4000-9682-934255975755","year":null},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.068364Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:bca1f800eb5a6cd084ad9d4601ef352a513e77b717f9c2235cb58d1947c3d002","observation_id":"f68ca61a-21d8-465b-9239-dd19f5b72050","resolution":{"observed_at":"2026-08-16T12:33:45.854175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.835652Z","title":"Decoupled weight de- cay regularization","venue":null,"work_id":"a06e5a03-d528-432f-bb7d-c3b6096c7fcc","year":2019},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.073164Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:cb0bd0a163a4f0dc58a9b5f8d99e738b4c9685e54cfd7d8a7c9b798f4ae0773f","observation_id":"02ce43ba-edb4-4727-be67-8050ee285cda","resolution":{"observed_at":"2026-08-16T12:33:45.840121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.819831Z","title":"Integer-valued training and spike-driven inference spiking neural network for high-performance and energy-efficient object detection","venue":null,"work_id":"684eceb9-b2cb-4e8a-b4fb-7b975d196cfa","year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.077761Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:0cd96bbb88f3ba580f8af54aabd5cd5ff4070dfb1b4f02dec8eaca6d0764b2d9","observation_id":"cfa01b67-b41b-4160-90f4-b4e40bbcf0a2","resolution":{"observed_at":"2026-08-16T12:33:45.824766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.804861Z","title":"Event-based moving object 12 detection and tracking","venue":null,"work_id":"986b8cbc-0440-4df7-a6d7-fe4be60f4ad7","year":2018},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.082367Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:55c462aaa79d2d184e147bb3a71236a3643daa95247fbed680d601127bb26d67","observation_id":"c3370488-1ea8-492f-9a40-ae424cf4d65b","resolution":{"observed_at":"2026-08-16T12:33:45.809465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.789215Z","title":"Rethinking transformers pre-training for multi- spectral satellite imagery","venue":null,"work_id":"feb13ea1-12da-42e1-a98c-3a54fcfcdc76","year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.087166Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:2d5578d783c5830178254968ada1d6762c54d524c5deff1b2f2609561a535c1a","observation_id":"e3dc42bd-b708-467e-86eb-359e73d63f8a","resolution":{"observed_at":"2026-08-16T12:33:45.794835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.092015Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.092015Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:243fae5573c6e8c9d52510082412962c447516b714bb663532c0947200d74757","observation_id":"5b8fe7b3-96cb-40c8-9a09-78a03e83ce5e","resolution":{"observed_at":"2026-08-16T12:33:45.092015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.765317Z","title":"Pytorch: An im- perative style, high-performance deep learning library","venue":null,"work_id":"67930d22-5e67-4e59-a13d-4a8c545a3619","year":2019},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.097788Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:26406675fbc1e9f4a4a04a58d24e8fd9aecb945976433bf39d5855edf829db61","observation_id":"20971ba1-d35b-46ab-99ed-729cfdd53ed2","resolution":{"observed_at":"2026-08-16T12:33:45.770086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06366","last_updated":"2022-10-03T11:47:10Z","snapshot_observed_at":"2026-08-20T00:42:31.854439Z","submitted_at":"2022-08-12T16:48:10Z","title":"BEiT v2: Masked Image Modeling with Vector-Quantized Visual Tokenizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06366","snapshot_observed_at":"2026-08-16T12:33:45.102760Z","title":"Beit v2: Masked image modeling with vector-quantized visual tokenizers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.102760Z"},"links":{"cited_paper":"/paper/2208.06366","citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:42dae82173091820638b25af16d2b59309663f6fdc5efecd66b563f21003b835","observation_id":"f8113807-ab7e-474d-9622-52d29421a468","resolution":{"observed_at":"2026-08-16T12:33:45.102760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.107543Z","title":"Detectors: Detecting objects with recursive feature pyramid and switch- able atrous convolution","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.107543Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:b91209e42a55754e58b65dc568f85e67900b7e0eaf9151ceb4ae3820239f4876","observation_id":"222c146c-c03c-48cb-a699-0c35812d253f","resolution":{"observed_at":"2026-08-16T12:33:45.107543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.112156Z","title":"Improving language understanding by gen- erative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.112156Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:a322a88a16b037236396fbccf51e981640bc856fe65fcafca493cbe72daf670c","observation_id":"0105fd7e-2943-4883-9f02-d8cbedb24a00","resolution":{"observed_at":"2026-08-16T12:33:45.112156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.116617Z","title":"Language models are unsu- pervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.116617Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:56bb05ef67576a1f5ef0281b95f645d8226b9c6045bd1121a2c72196d289fb6d","observation_id":"65c96e97-f43b-4d3d-bd3c-f7c288d743cb","resolution":{"observed_at":"2026-08-16T12:33:45.116617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.121084Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.121084Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:c0c3ba6b03c3be4cb4fe4b50f5b60f3ced3c34ee77790d7afc389cf6d23b2a4d","observation_id":"1ed4d3bd-0aa9-4d44-b1f5-6f872cb9e01f","resolution":{"observed_at":"2026-08-16T12:33:45.121084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.713138Z","title":"Scale-mae: A scale-aware masked autoencoder for multiscale geospatial representation learning","venue":null,"work_id":"59d1895b-0af5-48cc-94b2-2e584671fc8a","year":2023},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.125427Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:7a27c740d00d132c0854de16e4102e5aa33ffc9adb3ac317d93ba8ec1ed9b19d","observation_id":"3674552d-2517-4313-9bdd-5f19b8022cee","resolution":{"observed_at":"2026-08-16T12:33:45.717949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11010","last_updated":"2024-01-08T13:27:47Z","snapshot_observed_at":"2026-08-16T16:14:45.359883Z","submitted_at":"2022-11-20T16:01:31Z","title":"Revisiting Color-Event based Tracking: A Unified Network, Dataset, and Metric","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11010","snapshot_observed_at":"2026-08-16T12:33:45.130092Z","title":"Revisiting color-event based tracking: A unified network, dataset, and metric","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.130092Z"},"links":{"cited_paper":"/paper/2211.11010","citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:9e65b3d1190a1b424e5d07d23e5a245192d3274cac979258db28bb1a9317cc65","observation_id":"af078688-5acc-4713-a44c-21535e3343a3","resolution":{"observed_at":"2026-08-16T12:33:45.130092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.698241Z","title":"Humanbench: Towards general human- centric perception with projector assisted pretraining","venue":null,"work_id":"aa17b35b-6c63-479b-8153-f841ef6bd363","year":2023},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.135573Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:925e88e4d9fe5ebcf4349116ffd163dfe481d0020a73208e88620233de7467f7","observation_id":"e0f732fa-39b3-469c-96f1-09333daf40be","resolution":{"observed_at":"2026-08-16T12:33:45.703106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-16T17:12:17.691398Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-16T12:33:45.140311Z","title":"Videomae: Masked autoencoders are data-efficient learn- ers for self-supervised video pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.140311Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:0aa096169555d55f895c141216fafe4310fa8400de24e801d62704a5a79d5128","observation_id":"4ce8beff-01ba-4ca3-abd0-03ee8f555aa6","resolution":{"observed_at":"2026-08-16T12:33:45.140311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-16T12:33:45.145257Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.145257Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:027a1371363c10ee7c93cec145d76ff761c9f697cb3522af0b10af0066cfdc6a","observation_id":"a94de740-76e3-47cc-bd6c-d0cdec7f82f6","resolution":{"observed_at":"2026-08-16T12:33:45.145257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-16T12:33:45.149913Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.149913Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:9d0829e1119254287d2ea518cd829357c01da32fd60872a33ddfab14c9737c9c","observation_id":"0b3114b7-928e-4e90-af68-6b680b606807","resolution":{"observed_at":"2026-08-16T12:33:45.149913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.683993Z","title":"Videomae v2: Scaling video masked autoencoders with dual masking","venue":null,"work_id":"69469fb0-d171-46e6-a2b5-6e4d8491fd54","year":2023},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.154973Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:4a227b4efff577485c055524dfe4f6f965ac71e505eb474546005a67e3eefaa1","observation_id":"114a39bf-a593-480c-8fb7-a6c1635fbd4d","resolution":{"observed_at":"2026-08-16T12:33:45.688661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.668445Z","title":"Image as a foreign language: Beit pretraining for vision and vision- language tasks","venue":null,"work_id":"fe16c4d2-4342-48d9-88b8-1400560b0ca7","year":2023},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.159467Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:462377d764c6a1afcb299aebb9089683bf40c8fc76b7556b65a3b89cf0238f7c","observation_id":"2d48d814-d7c5-4c57-ba50-76c3c3e1a92b","resolution":{"observed_at":"2026-08-16T12:33:45.673472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.651628Z","title":"Vi- sevent: Reliable object tracking via collaboration of frame and event flows","venue":null,"work_id":"f8cf454b-b4d9-4135-ba75-345d13308815","year":1997},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.164092Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:419c427c68bcbcfe9319e9215d181b1ba17da818deae1c7a1868a7983bc7435e","observation_id":"659f7318-309d-43d2-bc62-70506a10c14d","resolution":{"observed_at":"2026-08-16T12:33:45.656566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06647","last_updated":"2024-12-09T16:40:34Z","snapshot_observed_at":"2026-08-15T03:22:00.059004Z","submitted_at":"2024-12-09T16:40:34Z","title":"Object Detection using Event Camera: A MoE Heat Conduction based Detector and A New Benchmark Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06647","snapshot_observed_at":"2026-08-16T12:33:45.168675Z","title":"Object detection using event camera: A moe heat conduction based detector and a new benchmark dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.168675Z"},"links":{"cited_paper":"/paper/2412.06647","citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:86ca1f5d55ea9a0e8e00fd8c8f1ead0babcb1cb7e1dd13de3c82682d12c1aef2","observation_id":"6cabab66-b653-495d-b316-1007dbcc9457","resolution":{"observed_at":"2026-08-16T12:33:45.168675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.17926","last_updated":"2024-04-27T14:29:53Z","snapshot_observed_at":"2026-08-20T20:08:32.793793Z","submitted_at":"2024-04-27T14:29:53Z","title":"Pre-training on High Definition X-ray Images: An Experimental Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.17926","snapshot_observed_at":"2026-08-16T12:33:45.173911Z","title":"Pre-training on high definition x-ray images: An experimental study","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.173911Z"},"links":{"cited_paper":"/paper/2404.17926","citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:c956d9df4904ffc0b7dd51e4663ccbea3ff54b616706b7f979621b48c0cd8fc9","observation_id":"d60a012c-cff1-4059-a3cb-6635e5bc8211","resolution":{"observed_at":"2026-08-16T12:33:45.173911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.636567Z","title":"Event stream-based visual object tracking: A high-resolution benchmark dataset and a novel baseline","venue":null,"work_id":"3efafa83-75fa-4b5d-8e72-b3ceb70aec5a","year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.178551Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:3b5bdfdd3689228f2d8bfe1b2879f8e5bdb7e272ffdb0d55699a94b75d735060","observation_id":"c82d5b01-70e9-4563-b000-c083b4671f72","resolution":{"observed_at":"2026-08-16T12:33:45.641198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.621840Z","title":"Structural information guided multimodal pre-training for vehicle-centric percep- tion","venue":null,"work_id":"e1c3bfb0-d981-4aab-ae0d-f9fd8fc2d642","year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.183525Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:3063ad5effe4cf4cbff5d769c2380276a6d70bf6c2042879eeec0e5de40084a2","observation_id":"5d19998c-fecb-40ec-a7f8-bb8dfc73f81b","resolution":{"observed_at":"2026-08-16T12:33:45.626716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.606431Z","title":"Hardvs: Re- visiting human activity recognition with dynamic vision sen- sors","venue":null,"work_id":"f0f60a3c-6c86-4a7f-a20c-e36828eee05c","year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.188277Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:80e084be85784668bbe1a91f91c3e9231a9d3e35bddf8487fec94470bc1ad472","observation_id":"519c5d77-222a-47be-a7be-b6cb6c73b803","resolution":{"observed_at":"2026-08-16T12:33:45.611488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.591210Z","title":"Multipath event-based network for low-power human action recognition","venue":null,"work_id":"1dad88b7-8d6b-4c7d-be24-2aff912c9aae","year":2020},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.192890Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:64cc4a15c289ccce0add58e349442cbfcdbda27fb084b7f9bf782fa09fe7d559","observation_id":"9f5af015-e868-42e2-9939-4bd60da1cd75","resolution":{"observed_at":"2026-08-16T12:33:45.596237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.197522Z","title":"Event camera data pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.197522Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:5421cb13be5bdf15a7c305e7e87a0c03f9b063b69c39c76d17eeda55c6cec314","observation_id":"6619c4a3-f1c4-4597-b17f-458372397f34","resolution":{"observed_at":"2026-08-16T12:33:45.197522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-16T12:33:45.202194Z","title":"Florence: A new foundation model for computer vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.202194Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:3e3c0929e6cecb0039d74eb1f78229995ded30560a0e8041927e64460d4dca38","observation_id":"015ff7b0-d559-4ef7-998a-84cc6be01d65","resolution":{"observed_at":"2026-08-16T12:33:45.202194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.566865Z","title":"Dino: Detr with improved denoising anchor boxes for end-to-end object de- tection","venue":null,"work_id":"8a7d73f4-21fa-422b-9e57-83686f0cec79","year":2022},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.207077Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:68b42e96b64a18ccd2cab2b5251a89e7e950cfc04123206cdf6df734ea8a8b23","observation_id":"f939e99e-2774-471e-8bab-d66d1273ef23","resolution":{"observed_at":"2026-08-16T12:33:45.571713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.211899Z","title":"Odtrack: Online dense temporal token learning for visual tracking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.211899Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:bfa5732442b30ebebbded92062b0da82e1a728496edf4f5ed892485b0f3a0caa","observation_id":"33f32570-e839-459e-96b9-e2096d899de8","resolution":{"observed_at":"2026-08-16T12:33:45.211899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.543439Z","title":"Image bert pre-training with online tokenizer","venue":null,"work_id":"bdf7eace-adaf-43f0-b52a-ee9251b76ce8","year":2021},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.216184Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:c0c42ed387f759a98ce1ff5234b74e7c0c7644368ef5be8d59386caaa02724a9","observation_id":"a1c57396-d39c-4ebe-93e8-8329ad2606f8","resolution":{"observed_at":"2026-08-16T12:33:45.547965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.528756Z","title":"Ex- act: Language-guided conceptual reasoning and uncertainty estimation for event-based action recognition and more","venue":null,"work_id":"059b40b6-c4dc-4e1a-a6c8-ac3d6a218cf3","year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.220773Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:5abf996e04ee9f247f7d7593d7a0562da5ffb74fa2d6a8ca35323e1119cf06b1","observation_id":"da8c1892-5d29-40d3-9215-cc601b1c1f3b","resolution":{"observed_at":"2026-08-16T12:33:45.533474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.512134Z","title":"Event-free moving object segmentation from moving ego vehicle","venue":null,"work_id":"bbbf94b7-53b4-4dc9-90b0-13ae6ab21295","year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.225157Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:5b7324beb9ae24ba925f7906863bc37f8a7f1e02bbc3f4baf07882d0d63bee02","observation_id":"b4b144e9-967a-4cd5-9f00-5ef8ae27502a","resolution":{"observed_at":"2026-08-16T12:33:45.518562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.229598Z","title":"Segment everything everywhere all at once","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.229598Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:4358c84e371de588409e434954059ff24d5591e78620cae1717e1a31b380e3bd","observation_id":"f30c6a45-9e2b-49b5-b6c3-1ba9152998fd","resolution":{"observed_at":"2026-08-16T12:33:45.229598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08386","last_updated":"2024-05-29T08:57:39Z","snapshot_observed_at":"2026-08-18T05:03:25.587175Z","submitted_at":"2023-05-15T06:49:00Z","title":"PLIP: Language-Image Pre-training for Person Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08386","snapshot_observed_at":"2026-08-16T12:33:45.234194Z","title":"Plip: Language-image pre-training for person representation learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.234194Z"},"links":{"cited_paper":"/paper/2305.08386","citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:4d5c1199c738773a3325e09344fddff3aaf48979041191100d9e12955182b956","observation_id":"4967cac0-fc44-4460-be2f-93c159ec9ba6","resolution":{"observed_at":"2026-08-16T12:33:45.234194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T22:54:09.488415Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":34},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2504.12576."}