{"as_of":"2026-08-13T22:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a0b93326af438cf1f7800dd186377c818a93a14ea31ccb285eeb3fe6645bf649","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T19:06:25.327098Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-03T21:20:00.041277Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T21:28:58.379714Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2508.13470","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13470","snapshot_observed_at":"2026-07-03T21:28:58.379714Z","title":null,"venue":null,"work_id":"43bf5bf4-ad30-46ed-b9a7-a7bfe57f652b","year":2025},"citing_paper":{"arxiv_id":"2607.02089","last_updated":"2026-07-01T14:25:43Z","snapshot_observed_at":"2026-08-02T16:57:02.105465Z","submitted_at":"2026-07-01T14:25:43Z","title":"ESC: Emotional Self-Correction for Reliable Vision-Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-03T21:20:00.041277Z"},"links":{"cited_paper":"/paper/2508.13470","citing_paper":"/paper/2607.02089"},"observation_digest":"sha256:94b530d86deaa3380bc6c10f4d9adf0b2cbd92b77d173520ad53e89678b01c30","observation_id":"ca2de7d7-d1d7-4c89-9448-115a09479bea","resolution":{"observed_at":"2026-07-03T21:28:58.381307Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.13470/citation-record","integrity":"/paper/2508.13470/integrity","json":"/paper/2508.13470/citation-record.json","paper":"/paper/2508.13470"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T19:06:22.867967Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:22.867967Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:09e4de2cd47ee8b6d38dfe616403c4ddeca9ef6caf7e2f1906398e5c20814010","observation_id":"a1ccbd97-d541-4f94-8c02-1e42ddfd6af8","resolution":{"observed_at":"2026-08-05T19:06:22.867967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:29.575633Z","title":"Qwen2.5-vl technical report, 2025","venue":null,"work_id":"d7e01987-28cf-45dd-9297-c040dfbe948a","year":2025},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:22.954759Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:15ba132ad1a17a048be2b65aef859574d43c1ce5d2f45f91abb61a95701ca54e","observation_id":"273c710f-7f77-4bba-87e7-804e49fe16e2","resolution":{"observed_at":"2026-08-05T19:06:29.641597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:29.405080Z","title":"Maplm: A real-world large-scale vision-language benchmark for map and traffic scene un- derstanding","venue":null,"work_id":"dd0bc416-91c4-47e6-875e-c992e9299e33","year":2024},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:23.004322Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:7688c7459bcadab3ea332a2fa11ca5145fda27f34a35bfc9ceb8c579db965048","observation_id":"2ee33d05-da6e-4be0-89fc-4f0f0d3a715c","resolution":{"observed_at":"2026-08-05T19:06:29.503846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:29.270322Z","title":"Cityllava: Efficient fine- tuning for vlms in city scenario","venue":null,"work_id":"8f17a6fd-f90f-419a-88cb-24bb7bec7b07","year":2024},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:23.047424Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:67d398c20338ff3d296eb88d4faaf0527a2e1f38139702ab0607a88a396f6c96","observation_id":"afc6916c-e97f-43e6-b66b-f4a376c76f49","resolution":{"observed_at":"2026-08-05T19:06:29.338854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:29.146642Z","title":"Cityllava: Efficient fine-tuning for vlms in city scenario","venue":null,"work_id":"8eb47230-72b5-4a9f-a64d-c5d637496a56","year":2024},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:23.121343Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:70194028ae69de5f8103a821de9cf05660636d378e93a90072f63652caf69124","observation_id":"97a332a3-6fda-4503-ab1c-039cbffc7f9f","resolution":{"observed_at":"2026-08-05T19:06:29.215166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:28.985635Z","title":"Optimal gradient checkpoint search for arbitrary computation graphs","venue":null,"work_id":"84af50e6-d7c6-46c3-9266-c2f3780a9e6c","year":2021},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:23.188507Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:702ef2bfec5c30846fa3123e94478fa7dad4a3603631dd15bcee3deb2cfd9880","observation_id":"683612bf-d7a1-485c-b5c1-8417c7c23426","resolution":{"observed_at":"2026-08-05T19:06:29.085557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:28.809411Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"1e7e9039-bdcd-4bee-8650-42be0953ab04","year":2022},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:23.240284Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:5d87df8c8ab17905a1fe6d452243cd5474c7d7729033d106561a024b7a13940f","observation_id":"73c536d8-c260-472d-896d-4d0875328523","resolution":{"observed_at":"2026-08-05T19:06:28.871406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:28.663235Z","title":"Better zero-shot reasoning with role-play prompting, 2024","venue":null,"work_id":"f6f90c93-7785-414f-ad2a-1b55f158544d","year":2024},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:23.340402Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:63e66deb5d0634b64c6ed3bc1287cf43f7123ac172e1f102801eeae91480703d","observation_id":"cc28c621-9006-4e38-b4a2-a4e01cc313bb","resolution":{"observed_at":"2026-08-05T19:06:28.728846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:28.488490Z","title":"Wts: A pedestrian-centric traffic video dataset for fine-grained spatial-temporal understand- ing","venue":null,"work_id":"ee246226-0b69-4f2b-9df1-7ae28446fee2","year":null},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:23.441211Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:5b4b0f3d27d130725a389d32db3b8479ca9b5bbac8abd466219127ffaa5bafe6","observation_id":"18c180c3-c576-499b-b6df-f33e92a77418","resolution":{"observed_at":"2026-08-05T19:06:28.580566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08282","last_updated":"2025-06-01T17:32:19Z","snapshot_observed_at":"2026-08-10T20:26:47.812479Z","submitted_at":"2025-01-14T17:58:12Z","title":"LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08282","snapshot_observed_at":"2026-08-05T19:06:23.616871Z","title":"Llava-st: A multimodal large language model for fine-grained spatial- temporal understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:23.616871Z"},"links":{"cited_paper":"/paper/2501.08282","citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:d0e002d0a03a529d0391f23bea156cf6b49d2654fe4ecf168f1788fa564b4af4","observation_id":"323ef9e9-47cc-41dc-8691-b32fc052179e","resolution":{"observed_at":"2026-08-05T19:06:23.616871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12589","last_updated":"2025-05-19T00:57:04Z","snapshot_observed_at":"2026-08-07T15:43:34.450000Z","submitted_at":"2025-05-19T00:57:04Z","title":"SurveillanceVQA-589K: A Benchmark for Comprehensive Surveillance Video-Language Understanding with Large Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12589","snapshot_observed_at":"2026-08-05T19:06:23.701939Z","title":"Surveillancevqa-589k: A benchmark for comprehensive surveillance video-language understanding with large mod- els","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:23.701939Z"},"links":{"cited_paper":"/paper/2505.12589","citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:8e08cfcb4cbc9ec432bb50e2ace0a43853ba69473bf00ea144004690e37438ed","observation_id":"4b115999-15e5-4575-8c98-d5ceb4a12853","resolution":{"observed_at":"2026-08-05T19:06:23.701939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:28.208481Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"c009b427-3bce-48ab-80b0-0fb4fda5bf2a","year":2024},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:23.781156Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:37501b988a0dd952d1a8777971ac26406b249e2964ae847a2e541f64137a40db","observation_id":"56de8027-29a1-481e-8680-aa6ead3cb860","resolution":{"observed_at":"2026-08-05T19:06:28.256587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:23.857493Z","title":"Improving generalization in visual reasoning via self-ensemble, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:23.857493Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:3516410e348c4c9ac4c3ce0225b45f9294301a01aec17fe80a3739412263843a","observation_id":"7f6b4a87-5206-469f-9fef-79ed1d70dd9d","resolution":{"observed_at":"2026-08-05T19:06:23.857493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:28.019564Z","title":"Hybrid, unified and itera- tive: A novel framework for text-based person anomaly re- trieval","venue":null,"work_id":"129e6702-048c-4499-99a6-622f1492e220","year":2025},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:23.920763Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:628fa112f8221bc4b2448b65a130ed23389b9f2264762871bf22087ac0fc42f3","observation_id":"6fd23e2d-cd9c-40d0-9a4d-56cb10567450","resolution":{"observed_at":"2026-08-05T19:06:28.124916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:27.862872Z","title":"Le, and Quang-Vinh Dinh","venue":null,"work_id":"6016965d-b07a-4d49-bc1d-aa9175ea235d","year":2025},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:23.979582Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:28517cd4fa5e4bb85c06597c5f8a623954a9244d7aeb5a4c2e7b2a3230efeaba","observation_id":"a6764805-6aa6-4800-b0fd-0c01c7d9b09c","resolution":{"observed_at":"2026-08-05T19:06:27.921115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:27.758456Z","title":"Gpt-4v(ision)","venue":null,"work_id":"2c25df04-108f-4a70-b3d0-0cdb27918150","year":2023},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:24.016832Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:5a2861f1dc84d09523520f5747c0adff411c10a22ebd15b99abfc2a3eb774a27","observation_id":"87a592ff-d671-481f-8425-e07c624a32d4","resolution":{"observed_at":"2026-08-05T19:06:27.797475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:27.589335Z","title":"Roadsocial: A diverse videoqa dataset and benchmark for road event understanding from so- cial video narratives","venue":null,"work_id":"eb87fe32-9add-49cd-8b39-f588f56d4ec3","year":null},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:24.075072Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:df3f30b0ac684af23ec834172e651d100f454f9b7367148bdbc248a277bbf520","observation_id":"b69b4d08-62d1-41bc-95b4-b66e6049efc0","resolution":{"observed_at":"2026-08-05T19:06:27.678940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:28.344545Z","title":"1, 2, 3, 5","venue":null,"work_id":"d423d619-f97a-496f-a7c7-a7fe1b8b1799","year":2024},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:23.527136Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:16e9aaabe8c774f1c29923776e0d237f595ae3058e564d2f769b529eaad501b7","observation_id":"5b6bc513-0163-4956-85fc-894ebf82f210","resolution":{"observed_at":"2026-08-05T19:06:28.401999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:27.455731Z","title":"Safeplug: Empow- ering multimodal llms with pixel-level insight and temporal grounding for traffic accident understanding, 2025","venue":null,"work_id":"3250168e-7f3d-4489-8822-50b06716eed3","year":2025},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:24.137473Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:3cf7e4d804cd8b825c0a65cecd22fabf1efdfd5f3205b681d6299be6172e515c","observation_id":"6f9b1c7d-cf42-4e37-a67e-0d548291fcac","resolution":{"observed_at":"2026-08-05T19:06:27.509429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:27.266491Z","title":"Scvlm: Enhancing vision-language model for safety-critical event understanding, 2025","venue":null,"work_id":"8159aff5-6505-497e-8347-f5ec715b1a3f","year":2025},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:24.221004Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:e697390c5f6b81ad9529911e6d24caea48d40b6183b8d4b7110b123aca02c120","observation_id":"6184360f-bbac-4af5-ab0c-a8d93fdd0657","resolution":{"observed_at":"2026-08-05T19:06:27.365440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:27.095814Z","title":"What does clip know about a red circle? vi- sual prompt engineering for vlms","venue":null,"work_id":"7af6b372-bcdb-47de-bc15-ad0fe68fca29","year":2023},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:24.286445Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:6ae3ef6a2ee39f24e413fd30a661fce46414dc1f601187e8bb34a514c8ce30f4","observation_id":"84a8b82a-efdc-4e8e-b6b4-d69547a4cf23","resolution":{"observed_at":"2026-08-05T19:06:27.181553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:26.894264Z","title":"Le, and Quang- Vinh Dinh","venue":null,"work_id":"9e6e2606-425e-4c66-801a-ef1a000f6f8d","year":2025},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:24.346433Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:bd6e939dfff29d22c55635c7295f0a7e57a1c2efe6b0c87055c3cc40d75cd47d","observation_id":"7fed3d03-dbc0-40ed-b51f-eec4ec332711","resolution":{"observed_at":"2026-08-05T19:06:26.981603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:26.757561Z","title":"Accidentgpt: A v2x environmental perception multi-modal large model for acci- dent analysis and prevention","venue":null,"work_id":"6393c298-72b1-4ca0-9549-65ceccaf6a02","year":2024},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:24.381382Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:9d905c9268b3e0c6ed7bb2730f1480a7d994b58c244c8bf5b37143532e35449b","observation_id":"8977a4f4-d9bc-4267-9041-e6ab6ab98974","resolution":{"observed_at":"2026-08-05T19:06:26.832408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:26.614076Z","title":"Anastasiu, Zheng Tang, Ming- Ching Chang, Yue Yao, Liang Zheng, Mohammed Shaiqur Rahman, Meenakshi S","venue":null,"work_id":"1226b92f-cbb9-4e52-a118-057c0997a731","year":2024},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:24.470008Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:bf6517e93b8662c4aba0a9b08dd8cfa0dca471a59c9016edd7c5e7fe85decf05","observation_id":"0cf37018-ff54-4d37-8b33-bd3c090bbe75","resolution":{"observed_at":"2026-08-05T19:06:26.668464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:26.444626Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":"de84572e-d677-47c8-9158-b9a4bb5d6808","year":2024},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:24.572649Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:f686f60a20f657830cda82134d2ff87a59fe63e3b7c01b862a6f889627d52e4a","observation_id":"23da6946-b704-42ff-8433-1fadd6fe12e4","resolution":{"observed_at":"2026-08-05T19:06:26.496382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:26.345167Z","title":"SUTD-TrafficQA: A Ques- tion Answering Benchmark and an Efficient Network for Video Reasoning Over Traffic Events","venue":null,"work_id":"a0e2d74f-c855-4a7d-90e0-5d27258de90a","year":2021},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:24.632142Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:a8d748e07918d5155dbafdb50922d0a54ca5b728b9af765644bf2b227c51576c","observation_id":"ebbe07ed-b501-4724-9d36-7ff24729e2b8","resolution":{"observed_at":"2026-08-05T19:06:26.379777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:26.188376Z","title":"Di- vide and conquer boosting for enhanced traffic safety de- scription and analysis with large vision language model","venue":null,"work_id":"e0e1a889-09c4-46ca-94ac-58e073e0b8f6","year":2024},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:24.730131Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:19756e873e27a6abe60645bc6ebbb3903e96cd30eb72ee7124e509c4e1a9d7fc","observation_id":"117f22c4-c441-4ad8-9258-a6695f8841c0","resolution":{"observed_at":"2026-08-05T19:06:26.263756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.11797","last_updated":"2022-05-20T07:05:41Z","snapshot_observed_at":"2026-08-13T18:05:33.797976Z","submitted_at":"2021-09-24T08:07:29Z","title":"CPT: Colorful Prompt Tuning for Pre-trained Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2109.11797","doi":null,"metadata_source":"pith","pith_arxiv_id":"2109.11797","snapshot_observed_at":"2026-08-05T19:06:25.690508Z","title":"CPT: Colorful Prompt Tuning for Pre-trained Vision-Language Models","venue":"cs.CV","work_id":"7331241b-8e1c-424c-8a6b-05b2fec5680c","year":2021},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:24.791229Z"},"links":{"cited_paper":"/paper/2109.11797","citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:cf0e1fcef5f1d3c78e1c84b57b15650fa87558df7fd4d9997bddba04b0666112","observation_id":"688e393a-b896-4e19-b5df-d7386dda7b8a","resolution":{"observed_at":"2026-08-05T19:06:25.771980Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:26.028876Z","title":"Bdd100k: A diverse driving dataset for heterogeneous multitask learning","venue":null,"work_id":"4b3641df-f42e-43c6-8038-1e23f7f325b1","year":null},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:24.856071Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:d94d9d50674c3fdf6189e813ebb83f1b2a31e6f3c7a796856d1741904f591a10","observation_id":"ea8fc92d-7dbb-49f8-9275-9a6d9b86247a","resolution":{"observed_at":"2026-08-05T19:06:26.105600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02520","last_updated":"2023-07-15T06:45:20Z","snapshot_observed_at":"2026-08-13T11:24:42.664753Z","submitted_at":"2023-06-05T01:01:12Z","title":"A Study of Situational Reasoning for Traffic Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02520","snapshot_observed_at":"2026-08-05T19:06:24.973033Z","title":"A study of sit- uational reasoning for traffic understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:24.973033Z"},"links":{"cited_paper":"/paper/2306.02520","citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:320434e7145b9bf8005f979d018e0f924ee5b018ad0152d149227cf3f06e8b71","observation_id":"84d2afda-c73a-4913-a5ae-9c33b2006d0b","resolution":{"observed_at":"2026-08-05T19:06:24.973033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10604","last_updated":"2025-01-17T23:35:34Z","snapshot_observed_at":"2026-08-11T01:13:50.295848Z","submitted_at":"2025-01-17T23:35:34Z","title":"When language and vision meet road safety: leveraging multimodal large language models for video-based traffic accident analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10604","snapshot_observed_at":"2026-08-05T19:06:25.069634Z","title":"When language and vi- sion meet road safety: leveraging multimodal large lan- guage models for video-based traffic accident analysis.arXiv preprint arXiv:2501.10604, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:25.069634Z"},"links":{"cited_paper":"/paper/2501.10604","citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:6aed8b2e12c53aad49d90e11e4acf3004a015caa1c7d2c1106375e43245933ce","observation_id":"b0cbf26b-8b6a-47ac-92ab-18eea1b1bb09","resolution":{"observed_at":"2026-08-05T19:06:25.069634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07853","last_updated":"2025-05-08T00:23:18Z","snapshot_observed_at":"2026-08-07T15:48:58.609424Z","submitted_at":"2025-05-08T00:23:18Z","title":"CrashSage: A Large Language Model-Centered Framework for Contextual and Interpretable Traffic Crash Analysis","version":1},"cited_work":{"arxiv_id":"2505.07853","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07853","snapshot_observed_at":"2026-08-05T19:06:25.457629Z","title":"CrashSage: A Large Language Model-Centered Framework for Contextual and Interpretable Traffic Crash Analysis","venue":"cs.CL","work_id":"3686e3af-012e-45a5-9dca-7f136dc8510f","year":2025},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:25.134699Z"},"links":{"cited_paper":"/paper/2505.07853","citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:b1fc2d981503b087397c3fee1bedb7b8c9b2ad1494dfaf3fdf02b10a72120cd7","observation_id":"41fe9ed6-f67d-4514-a3ac-efed3ca5e00f","resolution":{"observed_at":"2026-08-05T19:06:25.539818Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02449","last_updated":"2025-02-04T16:14:40Z","snapshot_observed_at":"2026-08-12T13:50:37.808922Z","submitted_at":"2025-02-04T16:14:40Z","title":"TUMTraffic-VideoQA: A Benchmark for Unified Spatio-Temporal Video Understanding in Traffic Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02449","snapshot_observed_at":"2026-08-05T19:06:25.219559Z","title":"Tumtraffic-videoqa: A benchmark for unified spatio- temporal video understanding in traffic scenes","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:25.219559Z"},"links":{"cited_paper":"/paper/2502.02449","citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:7c1eea7c96ec1dbd85d72368b77dc28f35e0b806ec7ba5ee8ed32faf1dbe23cd","observation_id":"e66332e3-e7c8-49e4-b33e-672f422eade7","resolution":{"observed_at":"2026-08-05T19:06:25.219559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:25.868613Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models, 2025","venue":null,"work_id":"c771c451-1a7e-420f-827b-b06d537b1447","year":2025},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:25.327098Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:7199b58c01a8be2826e082135286a672461492084005a20c5b217d84b9bee5c3","observation_id":"3610eae5-e259-4029-b6d7-b2658d72b531","resolution":{"observed_at":"2026-08-05T19:06:25.927402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T06:06:18.503386Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":2,"verified_fuzzy":25},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 1 inbound Pith citation observation for arXiv:2508.13470."}