{"as_of":"2026-08-15T21:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:916b15df94362a6535f7762f15959ca5c4f3845aa1c973daad7b15abcea66daf","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:02:31.527586Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T18:06:33.139310Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T05:30:58.338283Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"cited_work":{"arxiv_id":"2505.16594","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16594","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Temporal object captioning for street scene videos from lidar tracks","venue":null,"work_id":"018c51c9-4558-4f00-80bb-3a1dfb2b5b60","year":2025},"citing_paper":{"arxiv_id":"2604.08337","last_updated":"2026-04-09T15:10:25Z","snapshot_observed_at":"2026-08-15T08:40:29.351004Z","submitted_at":"2026-04-09T15:10:25Z","title":"InstAP: Instance-Aware Vision-Language Pre-Train for Spatial-Temporal Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T18:06:33.139310Z"},"links":{"cited_paper":"/paper/2505.16594","citing_paper":"/paper/2604.08337"},"observation_digest":"sha256:e5958db0555d9892382c826ee1eff6dcb8e75a5713a2628ec6092f4d81dd65b6","observation_id":"11b69413-3366-4aa4-99e1-a5a6081f42eb","resolution":{"observed_at":"2026-05-11T05:30:58.341882Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.16594/citation-record","integrity":"/paper/2505.16594/integrity","json":"/paper/2505.16594/citation-record.json","paper":"/paper/2505.16594"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.16839","last_updated":"2023-08-09T05:39:34Z","snapshot_observed_at":"2026-08-13T12:13:56.062238Z","submitted_at":"2023-03-29T16:42:30Z","title":"MaMMUT: A Simple Architecture for Joint Learning for MultiModal Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16839","snapshot_observed_at":"2026-08-07T15:02:28.003967Z","title":"Mammut: A simple architecture for joint learning for multimodal tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:28.003967Z"},"links":{"cited_paper":"/paper/2303.16839","citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:0af25c36ec28e0267e550544df568c8f2e74944aabdd05e0fb57a6c697e62fb8","observation_id":"6a669fc7-60d9-4fb6-934c-512dd9d7dfc8","resolution":{"observed_at":"2026-08-07T15:02:28.003967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13167","last_updated":"2023-05-22T15:54:22Z","snapshot_observed_at":"2026-08-15T13:09:11.048197Z","submitted_at":"2023-05-22T15:54:22Z","title":"VLAB: Enhancing Video Language Pre-training by Feature Adapting and Blending","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13167","snapshot_observed_at":"2026-08-07T15:02:28.118849Z","title":"Vlab: Enhancing video language pre- training by feature adapting and blending,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:28.118849Z"},"links":{"cited_paper":"/paper/2305.13167","citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:8f776da078f98e7d9c1a577bf56253faa8d2ea64a3903d46b614c5b4a77f3e84","observation_id":"b6247258-8cda-4e7a-a7c6-2fc1cfed444c","resolution":{"observed_at":"2026-08-07T15:02:28.118849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:34.334307Z","title":"Valor: Vision-audio-language omni-perception pretraining model and dataset,","venue":null,"work_id":"8d7a3b77-04bb-4138-883b-c5ed645f7a16","year":null},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:28.210380Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:253bd30a690461ca1d73dc3d085feb29dbb69edf71008c9948aa32b40af49072","observation_id":"3b89894d-f481-4bf4-bdc6-2a0216f92b91","resolution":{"observed_at":"2026-08-07T15:02:34.415561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.03597","last_updated":"2019-04-07T07:27:37Z","snapshot_observed_at":"2026-08-14T16:50:32.464750Z","submitted_at":"2019-04-07T07:27:37Z","title":"Self-supervised Spatio-temporal Representation Learning for Videos by Predicting Motion and Appearance Statistics","version":1},"cited_work":{"arxiv_id":"1904.03597","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.03597","snapshot_observed_at":"2026-08-07T15:02:32.272359Z","title":"Self-supervised Spatio-temporal Representation Learning for Videos by Predicting Motion and Appearance Statistics","venue":"cs.CV","work_id":"8eb325bd-a583-4039-9be2-f1239ff415e7","year":2019},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:28.384506Z"},"links":{"cited_paper":"/paper/1904.03597","citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:b6d406e555181c706d431d54f5974a1c010321d46b7a6fa3c7b1a841dedb5b8d","observation_id":"e6e64717-ff25-49de-8e4f-328ddcff60d6","resolution":{"observed_at":"2026-08-07T15:02:32.305348Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.01278","last_updated":"2019-08-13T08:31:13Z","snapshot_observed_at":"2026-08-14T16:37:36.073602Z","submitted_at":"2019-05-03T17:20:55Z","title":"Unsupervised Pre-Training of Image Features on Non-Curated Data","version":3},"cited_work":{"arxiv_id":"1905.01278","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.01278","snapshot_observed_at":"2026-08-07T15:02:32.092238Z","title":"Unsupervised Pre-Training of Image Features on Non-Curated Data","venue":"cs.CV","work_id":"e8bed5c1-be12-4d20-bb93-20be9ad30da3","year":2019},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:28.503146Z"},"links":{"cited_paper":"/paper/1905.01278","citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:ed25b8a704a194fb06d907e3e31eee7b054872478e325ef920bf724096e324b9","observation_id":"4f7c5dd5-252b-4021-9d20-722220d3cc6c","resolution":{"observed_at":"2026-08-07T15:02:32.192245Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:34.226065Z","title":"Melanoma thick- ness prediction based on convolutional neural network with vgg-19 model transfer learning,","venue":null,"work_id":"43984e18-7e4b-4347-92ba-354fbe182556","year":2019},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:28.606666Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:b067861ba908c1f8a5b0d433813c1631ee5ec4f1532ecf95e330815ace3dc728","observation_id":"b997e172-681e-4e16-924d-19d87ae7e4c3","resolution":{"observed_at":"2026-08-07T15:02:34.280853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:34.059999Z","title":"Pre-training on grayscale imagenet improves medical image classification,","venue":null,"work_id":"e2e74270-a1ed-4de5-99a3-3651bc9511b1","year":2018},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:28.716523Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:d544117828eb709b0ca7f0ee12efc7ab199dd0977a1728804478532cebfba6c5","observation_id":"9e3a94ff-32d1-4c6f-bc57-f825a6be1c7f","resolution":{"observed_at":"2026-08-07T15:02:34.149539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00212","last_updated":"2019-11-01T05:53:50Z","snapshot_observed_at":"2026-08-10T08:13:10.344821Z","submitted_at":"2019-11-01T05:53:50Z","title":"Low-Rank HOCA: Efficient High-Order Cross-Modal Attention for Video Captioning","version":1},"cited_work":{"arxiv_id":"1911.00212","doi":null,"metadata_source":"pith","pith_arxiv_id":"1911.00212","snapshot_observed_at":"2026-08-07T15:02:31.959496Z","title":"Low-Rank HOCA: Efficient High-Order Cross-Modal Attention for Video Captioning","venue":"cs.LG","work_id":"daa53820-a78b-48d9-a1e0-e5dc8dc45622","year":2019},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:28.782114Z"},"links":{"cited_paper":"/paper/1911.00212","citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:dde4e445b0b382912285cb6817d2f62b073651c7c63ab46a76f274442404020f","observation_id":"76007362-10d8-40c1-a4fc-dd3890e65c39","resolution":{"observed_at":"2026-08-07T15:02:32.020124Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:33.952225Z","title":"Sensor-augmented egocentric- video captioning with dynamic modal attention,","venue":null,"work_id":"832166c8-d922-4a34-bea5-3f9ea5f34b39","year":2021},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:28.879984Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:07e8791110cc089f72da1a3e1176b61e5abf7e0e677fa17bf266bd4d0fb54556","observation_id":"2f3fedb6-ae83-4424-bcc7-ae7b5f82b368","resolution":{"observed_at":"2026-08-07T15:02:33.986897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.11707","last_updated":"2022-02-01T19:17:11Z","snapshot_observed_at":"2026-08-13T18:40:09.889655Z","submitted_at":"2021-07-25T01:32:02Z","title":"Boosting Video Captioning with Dynamic Loss Network","version":3},"cited_work":{"arxiv_id":"2107.11707","doi":null,"metadata_source":"pith","pith_arxiv_id":"2107.11707","snapshot_observed_at":"2026-08-07T15:02:31.766144Z","title":"Boosting Video Captioning with Dynamic Loss Network","venue":"cs.CV","work_id":"bbc7a923-4cde-47f8-b63f-216b3efe94e7","year":2021},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:28.972803Z"},"links":{"cited_paper":"/paper/2107.11707","citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:19b765fce221002237a2b3b3f29b703c550a2bead4a8057594184a2a92a38ee8","observation_id":"b5cdd1d4-1dca-4046-ab49-b6c24b18fef1","resolution":{"observed_at":"2026-08-07T15:02:31.865243Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:29.036353Z","title":"Panoptic segmentation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:29.036353Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:632543ad0344a1bdc818bfa4a6df52f3d1521c2f73c4c68641e24a5e41674bcc","observation_id":"5634ddb2-30e4-4d4d-8e6d-29b3333a1cc4","resolution":{"observed_at":"2026-08-07T15:02:29.036353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:33.761142Z","title":"An empirical study of context in object detection,","venue":null,"work_id":"e859d2ff-c848-45a2-9334-5b7c6dc1d3cc","year":2009},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:29.104499Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:c8f7a13c8eb633a4a282b8128d562e64fa21029639ad67e308c6f826a279c08d","observation_id":"949b1838-94dc-43d9-b8fa-5857cc82c437","resolution":{"observed_at":"2026-08-07T15:02:33.817392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:29.171195Z","title":"End-to-end object detection with transformers,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:29.171195Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:6b1ffd30be8875433a44d6dd94b5a5f1fe77d9051cd58f6b581d7d09bf93ccf8","observation_id":"afa08809-6553-456f-99cb-ef07545707bb","resolution":{"observed_at":"2026-08-07T15:02:29.171195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-07T15:02:29.260811Z","title":"Internvideo: General video foundation models via gen- erative and discriminative learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:29.260811Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:fdf94f23aeab55990d39668684ea67c703c6baec35d3189bcbc25fc468028bb4","observation_id":"aa1a084a-51b0-4e57-94fe-f26759cc1cfd","resolution":{"observed_at":"2026-08-07T15:02:29.260811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15377","last_updated":"2024-08-14T14:31:50Z","snapshot_observed_at":"2026-08-13T00:47:41.087976Z","submitted_at":"2024-03-22T17:57:42Z","title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15377","snapshot_observed_at":"2026-08-07T15:02:29.351108Z","title":"Internvideo2: Scaling video foundation models for multimodal video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:29.351108Z"},"links":{"cited_paper":"/paper/2403.15377","citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:812d32ade1ab6338340f8153268dd5907685f383b9981977af633abd6dd5248f","observation_id":"b85f535a-1e35-4405-ac04-20df1c5043b4","resolution":{"observed_at":"2026-08-07T15:02:29.351108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-07T15:02:29.424508Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:29.424508Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:fa7f75969caea8c450e1c49b7342ffc34fbc27f661a200bc2425650b8aba2697","observation_id":"a9878bc4-bf6a-46ea-a9c2-b4267b312608","resolution":{"observed_at":"2026-08-07T15:02:29.424508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:33.642993Z","title":"Swinbert: End-to-end transformers with sparse attention for video captioning,","venue":null,"work_id":"97cf9084-416b-442a-a070-9227142df71d","year":2022},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:29.503052Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:8843e0f8864fad1d059b618f5200cc988074d1f4f80c177aadde45a563ef8cf9","observation_id":"9225c940-9e52-4dae-8ea7-c98fe7d9f569","resolution":{"observed_at":"2026-08-07T15:02:33.688236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:33.406520Z","title":"Lingoqa: Visual question answering for autonomous driving","venue":null,"work_id":"10fd9f86-06d7-4bf8-9f52-ba1697c13c7f","year":null},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:29.555237Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:27ed6dd6f12a24b24eabf86861695e39f7c276b18f73ebce3154844e9134e712","observation_id":"2e89f73c-4b20-447d-bb17-e1b31044843a","resolution":{"observed_at":"2026-08-07T15:02:33.524482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:29.616411Z","title":"Nuscenes-qa: A multi-modal visual question answering benchmark for autonomous driving scenario,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:29.616411Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:6f575ba48e69564cf347c9f06f9be4b5d34c603884a74ba7c445bc99f052f4b8","observation_id":"a9ad56f4-133c-4ee6-bf79-03698936ac9c","resolution":{"observed_at":"2026-08-07T15:02:29.616411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:33.161672Z","title":"Nuscenes-mqa: Integrated evaluation of captions and qa for autonomous driving datasets using markup annotations,","venue":null,"work_id":"feb50ca9-9c47-4114-979c-f99c48f8033e","year":2024},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:29.651915Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:43be7a06ea701f22a4ec93eb8c4d6ddf0a0916fa0642f0c944de4e630a6944c6","observation_id":"925d6cbf-a016-4395-9a47-23a0f46b9d60","resolution":{"observed_at":"2026-08-07T15:02:33.264972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04379","last_updated":"2025-03-30T15:11:24Z","snapshot_observed_at":"2026-08-13T10:17:49.877034Z","submitted_at":"2023-09-08T15:21:07Z","title":"Language Prompt for Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.04379","snapshot_observed_at":"2026-08-07T15:02:29.686171Z","title":"Language prompt for autonomous driving,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:29.686171Z"},"links":{"cited_paper":"/paper/2309.04379","citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:93d276466f461e9520f944a894ecd41f617fc33bfeada626a30a7acc0b204635","observation_id":"6b766470-5748-44f5-891c-013d71e87bed","resolution":{"observed_at":"2026-08-07T15:02:29.686171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:29.741400Z","title":"Covla: Comprehensive vision-language-action dataset for autonomous driving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:29.741400Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:38a36fb31207947d612569a3de4806289b4a3ab13793cd721d4424b250e1a25d","observation_id":"25fab8d1-523d-4e0e-9df9-39006acd7f1e","resolution":{"observed_at":"2026-08-07T15:02:29.741400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:29.802695Z","title":"nuscenes: A multimodal dataset for autonomous driving,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:29.802695Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:95038df99b08512a743a5370e30ca853d48bcdef92d26ca3e332a6fbc43e5f4e","observation_id":"2b7733b6-b7d0-4bc5-83eb-ee539c7f94d8","resolution":{"observed_at":"2026-08-07T15:02:29.802695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:29.858783Z","title":"Scalability in perception for autonomous driving: Waymo open dataset,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:29.858783Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:d4d7e197ac423c1434efb81e715eda8531015713b3275f75bf873fa9babe9c6a","observation_id":"db60efbf-4e4e-445d-92e1-340dcad7f9fc","resolution":{"observed_at":"2026-08-07T15:02:29.858783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:29.930690Z","title":"Kitti-360: A novel dataset and bench- marks for urban scene understanding in 2d and 3d,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:29.930690Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:a7a8e0aea10ca6a280446a282cc7a2423535e7260b5e6bb2a23b59d48b9fe53a","observation_id":"a54ae552-4df9-4c06-bf31-587fc7e0a5b6","resolution":{"observed_at":"2026-08-07T15:02:29.930690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T15:02:29.989811Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:29.989811Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:e18aeb42a3e3ebe147edf422ae086038882957cf114c44137d95e115f93cd800","observation_id":"afa8f4a0-e1a6-430d-9fb5-a6d3c098cadd","resolution":{"observed_at":"2026-08-07T15:02:29.989811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:30.026643Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:30.026643Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:747ced718d91c0ca264cc442be3319dcc067aa569703c180f3a49fbaa39c091b","observation_id":"2dee0491-bba6-46c1-a5e7-7ca30aeaa4df","resolution":{"observed_at":"2026-08-07T15:02:30.026643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:30.122872Z","title":"Training data-efficient image transformers & distillation through attention,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:30.122872Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:094fae475d8d3e1232586f85caa73efa015932e76567fd5e8e3cac8b9e9d6ce1","observation_id":"45e652a9-39a0-4b43-9bc1-48b7e076c746","resolution":{"observed_at":"2026-08-07T15:02:30.122872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:32.964700Z","title":"Is space-time attention all you need for video understanding?","venue":null,"work_id":"baafb15d-cfc8-4107-9d13-89a511804a29","year":2021},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:30.219968Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:094fe7af000679278c4d649c058fdd75ceacd718b9a4ee82bf9a4bc8a4fdb839","observation_id":"58587ce4-673f-4b34-bd10-5ab51d599d13","resolution":{"observed_at":"2026-08-07T15:02:33.026550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:30.284228Z","title":"Vivit: A video vision transformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:30.284228Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:58bfafd0220bd9a558f7a5b000298a56553836e7fce021ae3311be5e37627ab7","observation_id":"07fedb53-97ba-4763-a910-ed65e8bc7cb7","resolution":{"observed_at":"2026-08-07T15:02:30.284228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:32.809008Z","title":"Tuber: Tubelet transformer for video action detection,","venue":null,"work_id":"1851a992-3363-46cf-b115-825bc3aa432d","year":2022},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:30.350333Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:8db4949ecc5b98ec338a9b52e4014d33c4e5d91279ed179577869a8185669e69","observation_id":"dd8bcb5f-5428-46ce-b46f-026b0068a37b","resolution":{"observed_at":"2026-08-07T15:02:32.884734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:30.423962Z","title":"End-to-end video instance segmentation with transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:30.423962Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:7ef5389b40fcb0414d619d072c8599242d3aacfd916c1e3b4ff8315d722cb0bd","observation_id":"035c7db7-0b19-416e-906e-ce7a1a86a862","resolution":{"observed_at":"2026-08-07T15:02:30.423962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-07T15:02:30.614682Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:30.614682Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:be3c7a1289320df4def055d9e2bc0130c30627b88d7ecd42491a988945f56d29","observation_id":"b5ad08d6-56d4-4d43-95bf-2dd2207e1773","resolution":{"observed_at":"2026-08-07T15:02:30.614682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-07T15:02:30.732657Z","title":"Video-llava: Learning united visual representation by alignment before projection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:30.732657Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:fab518e0feae6b557a31ac9837918cd86c035146d7860e35f651a1fdb044cd15","observation_id":"27b94720-d27d-4e83-a7e7-a7abde96db36","resolution":{"observed_at":"2026-08-07T15:02:30.732657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:30.839297Z","title":"Adapt: Action-aware driving caption transformer,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:30.839297Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:61c1416af99eadf7990f1d1ae5a30947783d6da69f317ff668b8bb7778db1a1d","observation_id":"8cb8e2b0-b50f-42e5-94a6-69dda43a7026","resolution":{"observed_at":"2026-08-07T15:02:30.839297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:31.005990Z","title":"Textual explanations for self-driving vehicles,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:31.005990Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:e543bec6baa6ec5a52306daf660aff875b25aa5056b75496d3ff47986be50420","observation_id":"464de7ee-7eec-4f00-a9b4-cda0ef90f22f","resolution":{"observed_at":"2026-08-07T15:02:31.005990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-07T15:02:31.081961Z","title":"Internvid: A large-scale video-text dataset for multi- modal understanding and generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:31.081961Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:c260411a4fac6afec9e715520b6435f3eafbea8eaddbbba4bfc5714865eb8a32","observation_id":"8a76d122-1a03-4998-9597-ac78e3d31d83","resolution":{"observed_at":"2026-08-07T15:02:31.081961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:31.163340Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:31.163340Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:4a7e6abaa108fbb4c62bfc1f2365c73ec6ff53006bd5ca55553eb6794d24eac7","observation_id":"980049bf-5867-40d3-a61d-4ba25b3636a3","resolution":{"observed_at":"2026-08-07T15:02:31.163340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-14T23:20:42.336514Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-07T15:02:31.265644Z","title":"Very deep convolutional networks for large-scale image recognition,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:31.265644Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:bc197ee6a699d05422e73473f0b300052b175d7d599640b1045f7fb9ccb5b61c","observation_id":"b9b456bb-b459-4b12-83a8-43367164c6c5","resolution":{"observed_at":"2026-08-07T15:02:31.265644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:32.670756Z","title":"Can masking back- ground and object reduce static bias for zero-shot action recognition?","venue":null,"work_id":"de4f0631-1094-4ebf-aaeb-15ba607932b2","year":2025},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:31.322555Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:c7c7a97a1eb1d95d602ac606adb82720eb473f160728ee210c7d0af133f8cd15","observation_id":"1cb494fc-6a8a-4209-83c1-d2fbd34d1cd9","resolution":{"observed_at":"2026-08-07T15:02:32.723513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:32.555549Z","title":"Another efficient algorithm for convex hulls in two dimensions,","venue":null,"work_id":"21a841bb-5a58-4dd0-b0e4-e199ab1ef5a7","year":1979},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:31.379805Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:683abceb55c06e107bceec2d450fcf11a861d6400214b0efc7f5b8c9cd1f3c80","observation_id":"9facd20a-5781-42ff-b0e5-8da5a3718d0e","resolution":{"observed_at":"2026-08-07T15:02:32.612712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:32.407077Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":"fe7fe25f-4bcb-4188-8aad-5e686c2a74cb","year":2002},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:31.527586Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:74d5bb2bbb567bfdd8865f26ef469d6053e8a94ab811c6494b6b1b674d11da59","observation_id":"b2b4fe5d-c54d-45b9-9f43-7a3d6cf6d9dc","resolution":{"observed_at":"2026-08-07T15:02:32.472030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08345","last_updated":"2025-01-06T09:10:55Z","snapshot_observed_at":"2026-08-13T12:00:52.932273Z","submitted_at":"2023-04-17T15:08:15Z","title":"VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08345","snapshot_observed_at":"2026-08-07T15:02:28.305093Z","title":"Available: https://arxiv.org/abs/2304.08345","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:28.305093Z"},"links":{"cited_paper":"/paper/2304.08345","citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:87f8eae27dcca168db7de45ccd4bb4b842fc37c3e9646866f99a93265d37dc25","observation_id":"a349a548-3736-43a6-b28e-36458a90196b","resolution":{"observed_at":"2026-08-07T15:02:28.305093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T03:38:03.320969Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":4,"verified_fuzzy":13},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 1 inbound Pith citation observation for arXiv:2505.16594."}