{"as_of":"2026-08-10T02:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1d67357d06c53a23aa140ebcb16b323332b465b8cee21f7c8a3b4570aa249730","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:54:10.310454Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.12481/citation-record","integrity":"/paper/2506.12481/integrity","json":"/paper/2506.12481/citation-record.json","paper":"/paper/2506.12481"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:24.409582Z","title":"Action-net: Multipath excitation for action recognition,","venue":null,"work_id":"83130276-0874-487c-9e72-d2257a251aee","year":2021},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:04.567844Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:5fc238bedfafb7d1f8b6c3ad8f9333daf744f66a021ff7a7a3502e2391ba5c32","observation_id":"33ae0cbb-4038-4f82-abc3-4610f115b6e6","resolution":{"observed_at":"2026-08-07T00:54:24.615139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:24.135427Z","title":"Spa- tiotemporal self-attention modeling with temporal patch shift for action recognition,","venue":null,"work_id":"6831294b-abc3-4f6c-9463-a8e167889dfd","year":2022},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:04.618766Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:69a8f53f50737328153c615370c80fa6316a9921fe3b6d687555bd96549e87e2","observation_id":"ee869c44-cb35-42aa-9f14-7e0d3d9e2a1c","resolution":{"observed_at":"2026-08-07T00:54:24.240040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:23.835678Z","title":"Recurring the transformer for video action recognition,","venue":null,"work_id":"ca57f7dd-ff30-4cb5-86c0-af731c8f200d","year":2022},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:04.717366Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:3bf9d08b9d316422e13db87a1a0268bfcba373252453279e123b36527a5eaacb","observation_id":"10458ee1-fc22-4035-b16f-b98a2be23da6","resolution":{"observed_at":"2026-08-07T00:54:23.993701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:23.614830Z","title":"Graph convolutional module for temporal action localization in videos,","venue":null,"work_id":"e3e8db5c-e55f-4a2e-8eda-8218b2933f66","year":2021},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:04.799608Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:1bcbbc8d58ffc6c0246440721ceee12d966094f7b65b25a2435b517890922442","observation_id":"8c3fbca8-55b2-4f3a-ae88-4588751d188b","resolution":{"observed_at":"2026-08-07T00:54:23.705035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:04.889542Z","title":"Tent: Fully test-time adaptation by entropy minimization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:04.889542Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:5b431faeb4b402e0c8ae17d9b4029fdf79f83e887820bcdd67691f0877552527","observation_id":"d8c8c786-7de4-4842-b7c0-c913004154ff","resolution":{"observed_at":"2026-08-07T00:54:04.889542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:23.378688Z","title":"Memo: Test time robustness via adaptation and augmentation,","venue":null,"work_id":"5212b94f-1fa0-4e9e-b302-ca5c94949f88","year":2022},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:04.993798Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:8477dc61a1c266414c20e40481ff703524f613695f8bbaf68b3a7957765f1bd5","observation_id":"d6d6f54d-38c6-45c3-9c36-2a2d30a9815a","resolution":{"observed_at":"2026-08-07T00:54:23.485877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:23.027469Z","title":"Test-time classifier adjustment module for model-agnostic domain generalization,","venue":null,"work_id":"a572701c-1e27-4e04-b49e-ffb8c9caf4d7","year":2021},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:05.066115Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:b21b931a130259a795f770af9310c9b13392d73ad7742b1e74bd92bb70925798","observation_id":"2c7e5712-aaae-4611-b40f-f39171f40063","resolution":{"observed_at":"2026-08-07T00:54:23.195994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:22.768247Z","title":"The norm must go on: dynamic unsupervised domain adaptation by normalization,","venue":null,"work_id":"92395a25-5fc7-4357-b6f9-0e140905d901","year":2022},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:05.135072Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:58fbab6aa61d283ae27de365d3fcfa3e2eb0d353b80949f5dd5a44dc8a62cae8","observation_id":"bc74be26-e558-4bef-af5b-03f3aba10f92","resolution":{"observed_at":"2026-08-07T00:54:22.878578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:22.207041Z","title":"Test-time training with masked autoencoders,","venue":null,"work_id":"ea9e05c3-926c-4ce2-b068-154d1d33244e","year":2022},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:05.254178Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:0815e771357b931ccff11fef20067dd9936274b26b17d554591b689661c961cb","observation_id":"2e9a76d2-9df5-4787-a2c8-ed762a4f47ff","resolution":{"observed_at":"2026-08-07T00:54:22.349948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:21.938311Z","title":"Efficient test-time model adaptation without forgetting,","venue":null,"work_id":"b38324b3-417b-4c29-86b5-516f062692cd","year":2022},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:05.322903Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:cfb3f861f613ac1778706984d5348afda250ad0440ba6f6655de530472a23550","observation_id":"3495722d-2572-4367-aa3f-5915c6aa5dc8","resolution":{"observed_at":"2026-08-07T00:54:22.061736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:21.679201Z","title":"Test- time training with self-supervision for generalization under distribution shifts,","venue":null,"work_id":"e0d6ef94-0e39-44ca-b573-9c824050619a","year":2020},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:05.375815Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:b26ca748139b8eee502239e78d70d3555e6030189bc6e132230db874e56d43b7","observation_id":"c1ea4377-336a-4605-b6d8-3c1632d76d71","resolution":{"observed_at":"2026-08-07T00:54:21.785630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:21.414889Z","title":"Ttt++: When does self-supervised test-time training fail or thrive?","venue":null,"work_id":"94cdd013-59ad-4ae2-b2d8-e696fba62cf8","year":2021},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:05.448681Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:ecd6edb418a679b99945e3423d5ecfa6e6ce7a0d2c001a593bbd926eb016ce3d","observation_id":"84dd50fd-d4c4-4f41-899a-8a87e855d20c","resolution":{"observed_at":"2026-08-07T00:54:21.566451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:21.111877Z","title":"Video test-time adaptation for action recognition,","venue":null,"work_id":"c97794e0-b4ee-43c5-8537-6e00c3fc5055","year":2023},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:05.518462Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:04e0c4d2012f4278e6b39f73b217be8df85c5b91cd46e78a3d9331e31849daf9","observation_id":"c10440b1-1872-475a-aafb-534383584764","resolution":{"observed_at":"2026-08-07T00:54:21.264182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:20.873459Z","title":"Exploring motion cues for video test-time adaptation,","venue":null,"work_id":"a8eb2bb1-ab9b-47c2-9e0d-e9c3c6fddbe2","year":2023},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:05.610626Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:9de3f1f016eb7517238c13d18d6911f1d3aaba20dad71511e2b3b1c95a53196b","observation_id":"39240480-f0e0-46aa-bf14-37bc0fb45207","resolution":{"observed_at":"2026-08-07T00:54:21.000344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:20.590521Z","title":"Temporal coherent test time optimization for robust video classification,","venue":null,"work_id":"6c782118-5721-4902-82c4-a3a1265e5ce3","year":2023},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:05.690630Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:e279f4fb97de09b8a0b3b3b06b2b5fe2235f7685855a9a49d8a3b67f104edae8","observation_id":"868f3f2a-d989-4b31-9e57-31d4e654e113","resolution":{"observed_at":"2026-08-07T00:54:20.721022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:20.313273Z","title":"Ast: Audio spectrogram trans- former,","venue":null,"work_id":"f385b91f-c713-4c5d-94dc-c92fb64611fe","year":2021},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:05.784542Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:b619786afa7cbc58ad869270492f7b7725528e22140ff06bfe31b51b02edfcb6","observation_id":"91fc1409-706e-4903-9822-ac82210290cd","resolution":{"observed_at":"2026-08-07T00:54:20.447973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:19.996016Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":"ad9027bb-57a0-49d4-94a4-d6ca4fa38a64","year":2019},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:05.838913Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:38cd1066a48b4a9d98bc40139dc8e726b3d3cc2b5c612af1ef2c39e68eb85524","observation_id":"b65251ea-1f18-4f5e-b089-cf9994bdeab2","resolution":{"observed_at":"2026-08-07T00:54:20.157611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:19.756505Z","title":"Language models are few-shot learners,","venue":null,"work_id":"30f7cf3d-1ae8-4dcf-aca0-2a0a7d0523b2","year":2020},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:05.948670Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:a0ff44b5a704fc881577f1cc3c7e76c56a1e2c8b35fee1a98c76802fbfc47c68","observation_id":"c4706b51-6c68-4ebd-8e0b-3fdcc501bc46","resolution":{"observed_at":"2026-08-07T00:54:19.851606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:06.000889Z","title":"Benchmarking micro-action recognition: Dataset, methods, and applications,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:06.000889Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:30f05c8c0cd9ce728540719dbe507b08a8ce1bc337aec9dc690386f3d9f4cd4a","observation_id":"70221e23-df80-470b-a2b2-58c44d3425b0","resolution":{"observed_at":"2026-08-07T00:54:06.000889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:19.548732Z","title":"Repetitive action counting with hybrid temporal relation modeling,","venue":null,"work_id":"27811f42-96c3-4709-aa01-dbfa2edcf8ca","year":2025},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:06.065746Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:ab84d45daac98d549618ef8eb5924b6bd90903c95e616f162bdb96c5b583e51e","observation_id":"c6ff85e7-5055-4b09-a6ab-c043df2f96c8","resolution":{"observed_at":"2026-08-07T00:54:19.626432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14719","last_updated":"2025-04-15T12:11:11Z","snapshot_observed_at":"2026-08-03T15:15:24.967171Z","submitted_at":"2024-12-19T10:41:24Z","title":"Prototypical Calibrating Ambiguous Samples for Micro-Action Recognition","version":3},"cited_work":{"arxiv_id":"2412.14719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14719","snapshot_observed_at":"2026-08-07T00:54:11.316284Z","title":"Prototypical Calibrating Ambiguous Samples for Micro-Action Recognition","venue":"cs.CV","work_id":"85dea143-6760-46b7-9003-f1629ee0d15b","year":2024},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:06.134824Z"},"links":{"cited_paper":"/paper/2412.14719","citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:66ca3212f9fda021b528774c906e44333610179be41f0f086f612d85256ca755","observation_id":"7520c981-33b3-4f84-a967-38a94ee653a4","resolution":{"observed_at":"2026-08-07T00:54:11.422232Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:19.359124Z","title":"Test-time classifier adjustment module for model-agnostic domain generalization,","venue":null,"work_id":"0c598861-1ee8-466d-9f30-f5e9f91d0da9","year":2021},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:06.202380Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:afa19ddbdcaff36a45ee5ee05e35122a73384f861d2020336744aa5d27e76993","observation_id":"178c1827-fb16-4470-8a43-a91f2e495c3a","resolution":{"observed_at":"2026-08-07T00:54:19.444206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:19.106426Z","title":"Revisiting realistic test-time training: Se- quential inference and adaptation by anchored clustering,","venue":null,"work_id":"16f9e81a-e5b4-4164-8d27-89a16e8786ae","year":2022},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:06.281441Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:addc8795e16aa74adbeca401e76d4d6d10474a042dc2907efb5addcab503784f","observation_id":"ef41e3dd-1d18-4f5b-b14e-bb2a1a9827a9","resolution":{"observed_at":"2026-08-07T00:54:19.222262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.02355","last_updated":"2022-09-07T17:24:26Z","snapshot_observed_at":"2026-07-06T12:15:20.950385Z","submitted_at":"2021-12-04T15:01:35Z","title":"SITA: Single Image Test-time Adaptation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.02355","snapshot_observed_at":"2026-08-07T00:54:06.445024Z","title":"Sita: Single image test-time adaptation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:06.445024Z"},"links":{"cited_paper":"/paper/2112.02355","citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:de8650dd65f7632864478b9ba43cc5a30ee36373f14d555666c1ad0f9c381718","observation_id":"e7b9f108-df4e-422d-aee0-b29fe0e605e0","resolution":{"observed_at":"2026-08-07T00:54:06.445024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:22.450525Z","title":"Parameter- free online test-time adaptation,","venue":null,"work_id":"fe8d4297-18c5-4599-9fc8-932df04e1dda","year":2022},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:06.515578Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:2a6731338121b49d87e48c19cb7783c9365323cb6c83548596ffc6eb097e36b1","observation_id":"98665da7-8afb-46f2-85cd-083c4b518967","resolution":{"observed_at":"2026-08-07T00:54:22.606696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:18.922166Z","title":"Camera-aware recurrent learn- ing and earth mover’s test-time adaption for generalizable person re- identification,","venue":null,"work_id":"77f34777-b535-48d6-a5da-da2500f1f788","year":2023},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:06.595754Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:aca3988a609c2e9fc72fd85fe6f6fc26b244bc01586bbd3185c1c8d5c43483d6","observation_id":"d9f47279-cac6-4db3-ae65-aabd91af77d6","resolution":{"observed_at":"2026-08-07T00:54:19.006423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:18.640395Z","title":"Question type-aware debiasing for test-time visual question answering model adaptation,","venue":null,"work_id":"c4bb6365-1f55-4e08-91a1-fa07ae25802c","year":2024},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:06.646156Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:5ce8570f2b28c191c35a78300c23642f08204bcfde0ae3982756b0f037e57b6e","observation_id":"4af02cc9-a9bb-41b2-8a9f-5acf0a4dd16e","resolution":{"observed_at":"2026-08-07T00:54:18.793452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:18.383344Z","title":"Ttagaze: Self- supervised test-time adaptation for personalized gaze estimation,","venue":null,"work_id":"9481a52f-145a-4d11-bb07-48743b502ec2","year":2024},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:06.746865Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:0e238c4dff98108e8ac9203bf29e42ad6b618f453f777bd497ba65743c69dc98","observation_id":"426ef29f-b9f3-4086-95eb-a0d32b81d8f0","resolution":{"observed_at":"2026-08-07T00:54:18.520748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:18.101678Z","title":"What makes training multi-modal classification networks hard?","venue":null,"work_id":"5e4879bb-dbe0-408e-a1aa-23e346107a73","year":2020},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:06.826776Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:5478d613af5710ac5bf0e623146db3fad216880913c945b0ea8432da49ce0a3a","observation_id":"174aeb4e-61c4-42e6-9455-24baaf35f24f","resolution":{"observed_at":"2026-08-07T00:54:18.232489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:17.860855Z","title":"Self-supervised learning by cross-modal audio-video cluster- ing,","venue":null,"work_id":"3d9dbc27-5300-413c-aa14-77c2d24b86b8","year":2020},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:06.903443Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:87666750b54bfdb15ceeb08934199cd6c8b8734d819646679d42d2a685c40d34","observation_id":"255777d1-a2c8-4efb-8993-09c7139213b3","resolution":{"observed_at":"2026-08-07T00:54:17.967929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:06.978167Z","title":"Look, listen and learn,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:06.978167Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:f158285cb6c8e2777c2263c9199867eb0eda81d51d4aee9b2472268f7fb1db34","observation_id":"32c2113e-0cb1-47d9-9873-d608507ab27e","resolution":{"observed_at":"2026-08-07T00:54:06.978167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:17.630579Z","title":"Epic-fusion: Audio-visual temporal binding for egocentric action recognition,","venue":null,"work_id":"bc5a567f-6fd1-43d9-bb7a-90e141e3d59d","year":2019},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:07.054009Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:4ade2acddecf6daf4a6ba195c4b787a984a60460c8c0714cb8369fff3f3bd788","observation_id":"91176f35-89b1-40de-9e1b-290dcc898439","resolution":{"observed_at":"2026-08-07T00:54:17.726461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:17.329175Z","title":"Exploring multimodal video representation for action recognition,","venue":null,"work_id":"d7da58eb-aba6-47fc-b16b-259ffdc28ed9","year":2016},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:07.124278Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:9abc69ca859af513fc147ce9e26cde26a3d0f49f35e5c913d4df0a6b2fb6e98c","observation_id":"085ab076-13e7-4e6a-8a21-931541ac745c","resolution":{"observed_at":"2026-08-07T00:54:17.454728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:17.071174Z","title":"Slowfast networks for video recognition,","venue":null,"work_id":"a6e1d220-6f15-45f2-b5d4-df8a5ad05d52","year":2019},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:07.191632Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:dc3bc0dca735c4ea0f0d4e2f75a7e43360dd059d31636c7018930c8b4eeee94e","observation_id":"23b8b71f-fc10-4aae-ae61-be9c24406bd2","resolution":{"observed_at":"2026-08-07T00:54:17.205407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:16.813592Z","title":"Attention is all you need,","venue":null,"work_id":"03ad1736-d6d1-4701-8779-d952e5047e5b","year":2017},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:07.258909Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:ac0463d2dea8792ea3454bf9220e174c3bd942da1cf91316b799faeb1c461ab6","observation_id":"6fd2c850-6ad3-497b-9e49-8f6d456f83a1","resolution":{"observed_at":"2026-08-07T00:54:16.943553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:16.570525Z","title":"Polyvit: Co-training vision transformers on images, videos and audio,","venue":null,"work_id":"e7664ede-d9bb-4e29-b3be-8a24e3bdcb17","year":2023},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:07.337614Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:8f8d63757142122990cc49e870590c2819fe69f0953b72c659a52de08a868d5f","observation_id":"fb303fa4-2626-4463-a998-61c25ca33da5","resolution":{"observed_at":"2026-08-07T00:54:16.667500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:16.347230Z","title":"Attention bottlenecks for multimodal fusion,","venue":null,"work_id":"e150bfc0-9a81-4855-969f-6a832805b1e5","year":2021},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:07.455568Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:ccc47f234fa8aaf577e968bc7d4ed6784700db690eb717ea9ddf1674225adf56","observation_id":"b16713c7-918d-429d-855c-720015e773d1","resolution":{"observed_at":"2026-08-07T00:54:16.446415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:16.089801Z","title":"Mm-vit: Multi-modal video transformer for compressed video action recognition,","venue":null,"work_id":"835731d5-25c3-4d30-8237-25a222010274","year":2022},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:07.518122Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:e482d3720dcdad2ef9f68c5167f1b98b5e810e32c24f7ebc32b2ebc90b392a9c","observation_id":"dcf141e3-719f-4d7e-a95d-e6b3f163ad40","resolution":{"observed_at":"2026-08-07T00:54:16.200539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:15.779778Z","title":"Multimodal video summa- rization via time-aware transformers,","venue":null,"work_id":"96928d02-da37-41fd-ad07-d254a660cb19","year":2021},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:07.586329Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:0620d3cb2f76ab1cff98e06a8d35cbd2b1291dc1fb0e3af3d1aa53560e510a00","observation_id":"e23503e9-c259-49d7-b4b0-9f13b0e6a016","resolution":{"observed_at":"2026-08-07T00:54:15.879756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:15.554908Z","title":"Bootstrapping audio-visual video segmentation by strengthening audio cues,","venue":null,"work_id":"4f79f4fa-0ba4-4932-b53a-11b59d857174","year":2024},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:07.655498Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:bd8248a25dfe45246a1f5d0fbd9dc3af9016efbf1af95f953a1fa6628a291213","observation_id":"5bf451c0-f468-4d10-af81-edc6f728bcc2","resolution":{"observed_at":"2026-08-07T00:54:15.684124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:15.277943Z","title":"Multimodal imbalance-aware gradient modulation for weakly-supervised audio-visual video parsing,","venue":null,"work_id":"dc4cfbb7-15cd-4c34-87a5-2a2df34ca020","year":2023},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:07.721031Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:96de1f0910a4fe525094b108c79591527651eb27e06824bac3f85800b4362db6","observation_id":"9bdd4f10-6020-4ed5-b822-df7c825746f8","resolution":{"observed_at":"2026-08-07T00:54:15.364959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.01689","last_updated":"2021-06-03T08:46:43Z","snapshot_observed_at":"2026-07-06T11:15:30.045776Z","submitted_at":"2021-06-03T08:46:43Z","title":"Cross-Domain First Person Audio-Visual Action Recognition through Relative Norm Alignment","version":1},"cited_work":{"arxiv_id":"2106.01689","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.01689","snapshot_observed_at":"2026-08-07T00:54:11.040331Z","title":"Cross-Domain First Person Audio-Visual Action Recognition through Relative Norm Alignment","venue":"cs.CV","work_id":"f56837c6-b977-4723-9161-4fa184c05675","year":2021},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:07.779728Z"},"links":{"cited_paper":"/paper/2106.01689","citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:3dc83280cb9f6b2cce94265b7e1a2f0e235e8da47475643aa45c899304361f4b","observation_id":"9d225224-9080-4aae-9bab-c8c718e3a678","resolution":{"observed_at":"2026-08-07T00:54:11.168964Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:15.035036Z","title":"Domain generalization through audio-visual relative norm align- ment in first person action recognition,","venue":null,"work_id":"31719ff5-75e1-4c20-86f5-408b1849e6a9","year":2022},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:07.851954Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:e04f0b2a023835c82456b08b9701bc426e516e965abfcef6aee22223aa390f50","observation_id":"aad33de7-7250-4584-acf3-6102305d0e99","resolution":{"observed_at":"2026-08-07T00:54:15.133343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.10026","last_updated":"2021-07-01T02:56:46Z","snapshot_observed_at":"2026-07-06T11:20:38.670388Z","submitted_at":"2021-06-18T10:03:30Z","title":"EPIC-KITCHENS-100 Unsupervised Domain Adaptation Challenge for Action Recognition 2021: Team M3EM Technical Report","version":3},"cited_work":{"arxiv_id":"2106.10026","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.10026","snapshot_observed_at":"2026-08-07T00:54:10.742646Z","title":"EPIC-KITCHENS-100 Unsupervised Domain Adaptation Challenge for Action Recognition 2021: Team M3EM Technical Report","venue":"cs.CV","work_id":"10bdd8c8-36a4-46b9-a896-c4869c22e936","year":2021},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:07.929631Z"},"links":{"cited_paper":"/paper/2106.10026","citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:674b714f747f0e63062455a9f58e5ef4e65ca7af5c5c41120b3a81c722caf366","observation_id":"59d7580c-d9ac-49f8-850d-120223135aa0","resolution":{"observed_at":"2026-08-07T00:54:10.875629Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:14.772101Z","title":"Audio-adaptive activity recognition across video domains,","venue":null,"work_id":"29a096e4-0a6b-4eb5-a711-2243a80bb424","year":2022},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:07.986874Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:424eee87f3cca27c72d16255f3321dc744d50cce4165a20cf05f8b2b87ecd712","observation_id":"d358d349-6e20-44f5-a9dd-9e2524f5621e","resolution":{"observed_at":"2026-08-07T00:54:14.886959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.10963","last_updated":"2021-01-14T21:11:06Z","snapshot_observed_at":"2026-08-06T05:58:45.817385Z","submitted_at":"2020-06-19T05:08:43Z","title":"Evaluating Prediction-Time Batch Normalization for Robustness under Covariate Shift","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.10963","snapshot_observed_at":"2026-08-07T00:54:08.059471Z","title":"Evaluating prediction-time batch normalization for robustness under covariate shift,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:08.059471Z"},"links":{"cited_paper":"/paper/2006.10963","citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:b02ba724e0570ea65203b874fcc6f81ee66ff68ab156cfd61f9e903b24cc239e","observation_id":"490a2777-9fd1-498a-b718-385ebbfdf2b5","resolution":{"observed_at":"2026-08-07T00:54:08.059471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:14.521595Z","title":"Do we really need to access the source data? source hypothesis transfer for unsupervised domain adaptation,","venue":null,"work_id":"e6770457-d5ed-489d-8d28-c8215e0eb324","year":2020},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:08.145311Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:66326880a9b71ca9c72d587fb8bee78699a3b38128cc02c71bf0851e9acfde33","observation_id":"07ed5fe3-4fa2-4c93-9df1-22ac58be4d8f","resolution":{"observed_at":"2026-08-07T00:54:14.624959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:14.351944Z","title":"Improving robustness against common corruptions by co- variate shift adaptation,","venue":null,"work_id":"c2309f73-21f1-48b1-8254-f33869169a5a","year":2020},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:08.228981Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:6eaa758f8e393eddaea6ec42cf23f10bf0996668edd5ecc502f2c7b0d83e4f5b","observation_id":"dc90267e-2b60-4a94-b076-e9ad0be78f72","resolution":{"observed_at":"2026-08-07T00:54:14.417289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:14.168029Z","title":"Entropy is not enough for test-time adaptation: From the perspective of disentangled factors,","venue":null,"work_id":"f6f60e57-9fa1-424f-ada8-ff8485376a23","year":2024},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:08.301199Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:7d8a8250a269cf6373ecf80ae04415ffb2561f591955e18269397a13ab6c3ac2","observation_id":"d93c796a-0242-4373-beae-a396379c58d4","resolution":{"observed_at":"2026-08-07T00:54:14.240539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:08.407003Z","title":"Universal test-time adaptation through weight ensembling, diversity weighting, and prior correction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:08.407003Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:7bf8c11efe12b2f6a47ac5aa340eeb279963789efbff1cc3996709c9bd362bd2","observation_id":"0476f983-fb1a-487f-b7f6-fdf12a861e8a","resolution":{"observed_at":"2026-08-07T00:54:08.407003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09685","last_updated":"2023-08-18T17:13:45Z","snapshot_observed_at":"2026-07-06T16:07:45.513778Z","submitted_at":"2023-08-18T17:13:45Z","title":"Audiovisual Moments in Time: A Large-Scale Annotated Dataset of Audiovisual Actions","version":1},"cited_work":{"arxiv_id":"2308.09685","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.09685","snapshot_observed_at":"2026-08-07T00:54:10.497735Z","title":"Audiovisual Moments in Time: A Large-Scale Annotated Dataset of Audiovisual Actions","venue":"cs.LG","work_id":"55312479-4da3-445d-95d7-e44c745e369e","year":2023},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:08.481578Z"},"links":{"cited_paper":"/paper/2308.09685","citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:5aeca1ae88e1e55bc4377b4eb84619f73410fe0e1d892b2d87507a73677721f6","observation_id":"e768709d-a74b-4c7f-a212-9d9dd48ce3f1","resolution":{"observed_at":"2026-08-07T00:54:10.599730Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:08.563466Z","title":"Audio-visual event localization in unconstrained videos,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:08.563466Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:74f680dac44be09d399934f381d0e162d390e6cabc513af7a97a4e8bee4698ca","observation_id":"7c8791cc-cb44-4098-89e3-c7f0b9e6e398","resolution":{"observed_at":"2026-08-07T00:54:08.563466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:13.952441Z","title":"Audio set: An ontology and human- labeled dataset for audio events,","venue":null,"work_id":"704a5322-2f5d-4193-a97c-42da7b118778","year":2017},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:08.636158Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:92fb2e76c0987fe684e4c9e8db4cd5f9c865212c91dda485d12e1d8a671e08ed","observation_id":"b130993e-00e3-4e84-93ae-9c0080fb87fc","resolution":{"observed_at":"2026-08-07T00:54:14.034428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-07T00:54:08.763811Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:08.763811Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:495a571de0f7f880531b4fffca7032afc5083a36f0e2bc319748a25256391d89","observation_id":"36651001-5f58-4677-9828-bb06c1502279","resolution":{"observed_at":"2026-08-07T00:54:08.763811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-07T00:54:08.874815Z","title":"The kinetics human action video dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:08.874815Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:8d74b2610f00764a6e5b47196e03e2066103d5d9d1e94cf8977e233c2de015a8","observation_id":"3574da86-e5cc-46e9-8e52-1f40c592e625","resolution":{"observed_at":"2026-08-07T00:54:08.874815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:13.718108Z","title":"Large-scale robustness analysis of video action recognition models,","venue":null,"work_id":"f9657085-68c2-436d-b014-c6f7cc0597dc","year":2023},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:09.001476Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:cca4db58f09df15c0c4809227714e4c8abff3983b313d4eb8d0256b01b2726cb","observation_id":"b8e4cf70-b82d-4853-8bd2-105440ec9aaf","resolution":{"observed_at":"2026-08-07T00:54:13.827545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:13.477755Z","title":"Benchmarking the ro- bustness of spatial-temporal models against corruptions,","venue":null,"work_id":"40e052bc-6d9c-430b-b8e0-862850bd2b1a","year":2021},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:09.163831Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:d216e8cf10a7ec83723159e46c648b05ce5eb1c8f2c5178f220b53ba3a112519","observation_id":"4e846e41-3dc4-440c-8be9-eb0aaa189ba4","resolution":{"observed_at":"2026-08-07T00:54:13.597851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:13.209909Z","title":"Tam: Temporal adaptive module for video recognition,","venue":null,"work_id":"12f4bf1e-890b-4ef8-95d1-928871c4e5b3","year":2021},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:09.279285Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:4f02d22fd93600f6524add38fd8ceabbccde5cc1dc583a6ae7dd96b3b6837e29","observation_id":"2a2a7b6d-6b0b-4dd2-ab25-f9a9fc0582ef","resolution":{"observed_at":"2026-08-07T00:54:13.364637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:12.982634Z","title":"Tsm: Temporal shift module for efficient video understanding,","venue":null,"work_id":"4a02f8cc-2bd4-448a-b245-151bac6622ca","year":2020},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:09.361593Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:1a544eaf258cb8cdff3a4c101474f4f61e1a1127e641ca492123ca050713bcfb","observation_id":"46ee0324-101f-42ee-aab1-47ce005d4311","resolution":{"observed_at":"2026-08-07T00:54:13.073191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:09.442939Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:09.442939Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:c579e7a99d810bafa7c7bd9ee472a3532fb6d581191d6241122cd00b344ff8e7","observation_id":"87006b49-a61e-4ac3-9280-5a8f1af116ed","resolution":{"observed_at":"2026-08-07T00:54:09.442939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T00:54:09.583647Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:09.583647Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:2619c239d3d7dbf3c5019a30dbed0f2d3646a780b80bd6e95372ef895824e9b8","observation_id":"63070090-db99-4110-ac56-e39954512b6b","resolution":{"observed_at":"2026-08-07T00:54:09.583647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:12.719484Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":"042d7623-703a-44d7-9b61-5448f2302c25","year":null},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:09.675286Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:24d835e785f1c112fd00c72d3f8005df985e5ee98a7f6584f0a3f58279fad025","observation_id":"509beed8-46ef-43fc-b9db-5dcc97aeaea0","resolution":{"observed_at":"2026-08-07T00:54:12.826462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T00:54:09.790417Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:09.790417Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:fe4f111a181a3f2e42868c69e282cb003e6ada87947118892c31b9650e1bc3c8","observation_id":"8f407caa-0ac6-4087-82e7-a198afb82056","resolution":{"observed_at":"2026-08-07T00:54:09.790417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:12.415243Z","title":"Binggpt: Desktop application of new bing’s ai-powered chat,","venue":null,"work_id":"a1909ddc-bca6-4f37-9460-2f644df25495","year":2024},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:09.936000Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:8abaf5825820eba231a1fa54ed7a803b405ddfaeac2a95e5671d4cb0945d4ac7","observation_id":"ae8a3d41-acce-48ab-98aa-75f321b8c5bd","resolution":{"observed_at":"2026-08-07T00:54:12.566777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:12.185934Z","title":"Audio mamba: Bidirectional state space model for audio representation learning,","venue":null,"work_id":"c1fd412c-8cfd-40c2-8524-bd8b346cfd59","year":2024},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:10.052087Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:76bb0a238557a0893119cc3886ca049c26df7b62d6eb0d56873589aab93aa009","observation_id":"11f5fe04-e0d2-4495-9474-6b730c5133c5","resolution":{"observed_at":"2026-08-07T00:54:12.285855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:11.905724Z","title":"Beats: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":"57690836-a0ea-4f8d-8f46-9c2de784a189","year":2023},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:10.186685Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:b476b32f9a531ae6936839ef91d1fcfdd756a7c241c92fcb7b639d76e46b98b8","observation_id":"74beaab0-40bb-4086-b1e8-2dedecce1868","resolution":{"observed_at":"2026-08-07T00:54:12.035490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:11.587663Z","title":"Tim: A time interval machine for audio-visual action recognition,","venue":null,"work_id":"6944af18-d4ba-4a14-a416-16bb58f9f6a4","year":2024},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:10.310454Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:279124acf87ae665e0f420256e7c4f0c7fc74abaa2837441a5af631c32a4993c","observation_id":"1976f334-fbb2-432d-bf83-acf962a6dd6f","resolution":{"observed_at":"2026-08-07T00:54:11.746977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":4,"verified_fuzzy":51},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2506.12481."}