Pith. sign in

Paper Citation Record · LEDGER

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation

As of 12 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2506.12481.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.12481 v1

Coverage vector

measured 67 of 67 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T00:54:10.310454Z

measured 67 of 67 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-12T06:34:41.77262+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

67 of 67 outbound references displayed

  • verified exact4
  • verified fuzzy51
  • unresolved12
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 33ae0cbb-4038-4f82-abc3-4610f115b6e6 · outbound

This paper cites Action-net: Multipath excitation for action recognition,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Action-net: Multipath excitation for action recognition,

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:24.615139Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:04.567844Z digest=sha256:0803a386ed5d3b60dfe82f6c72771a296f5e2eb64d2dede91052437b67af3101

Observation ee869c44-cb35-42aa-9f14-7e0d3d9e2a1c · outbound

This paper cites Spa- tiotemporal self-attention modeling with temporal patch shift for action recognition,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Spa- tiotemporal self-attention modeling with temporal patch shift for action recognition,

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:24.240040Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:04.618766Z digest=sha256:99075ba1b3ee273957417145806b38577a2fd53364887aa212fca1f2bb1bc786

Observation 10458ee1-fc22-4035-b16f-b98a2be23da6 · outbound

This paper cites Recurring the transformer for video action recognition,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Recurring the transformer for video action recognition,

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:23.993701Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:04.717366Z digest=sha256:c0e4aee81b166ee10ad64fe7f96630ba41f7734a2594c52901c854ccdd2d0f54

Observation 8c3fbca8-55b2-4f3a-ae88-4588751d188b · outbound

This paper cites Graph convolutional module for temporal action localization in videos,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Graph convolutional module for temporal action localization in videos,

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:23.705035Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:04.799608Z digest=sha256:af1c647d7e703b170dc84717abbdcb53d9d932f2333d2cddb4ab5c6e559b2c2b

Observation d8c8c786-7de4-4842-b7c0-c913004154ff · outbound

This paper cites Tent: Fully test-time adaptation by entropy minimization,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Tent: Fully test-time adaptation by entropy minimization,

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T00:54:04.889542Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:54:04.889542Z digest=sha256:3e293a7bc3b95068857a34b6f99ea8f0b2cdffbb5589e75b0d39a14055ec9e3d

Observation d6d6f54d-38c6-45c3-9c36-2a2d30a9815a · outbound

This paper cites Memo: Test time robustness via adaptation and augmentation,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Memo: Test time robustness via adaptation and augmentation,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:23.485877Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:04.993798Z digest=sha256:a9ae3f13a4d0f7c1ecf19ed16e3005bef1ed21236bb755d94e447cfe0cd8f3ad

Observation 2c7e5712-aaae-4611-b40f-f39171f40063 · outbound

This paper cites Test-time classifier adjustment module for model-agnostic domain generalization,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Test-time classifier adjustment module for model-agnostic domain generalization,

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:23.195994Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:05.066115Z digest=sha256:b75b8fd23bc2920e07b124f58dc2d208584937c6c41d91e9e5029f02ab269bf6

Observation bc74be26-e558-4bef-af5b-03f3aba10f92 · outbound

This paper cites The norm must go on: dynamic unsupervised domain adaptation by normalization,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation The norm must go on: dynamic unsupervised domain adaptation by normalization,

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:22.878578Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:05.135072Z digest=sha256:c3efae5b4f9489e530ecc1518b3cd108a007d371270988fe1d3226f95f8091fe

Observation 2e9a76d2-9df5-4787-a2c8-ed762a4f47ff · outbound

This paper cites Test-time training with masked autoencoders,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Test-time training with masked autoencoders,

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:22.349948Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:05.254178Z digest=sha256:94b3982a456825600aada236a41351f23fbb58a67bb945ac33de94fd96606bef

Observation 3495722d-2572-4367-aa3f-5915c6aa5dc8 · outbound

This paper cites Efficient test-time model adaptation without forgetting,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Efficient test-time model adaptation without forgetting,

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:22.061736Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:05.322903Z digest=sha256:3c252e662007f2b2ad4713c9725681b0012ad6e4cd2be84327c6fd2798cadf40

Observation c1ea4377-336a-4605-b6d8-3c1632d76d71 · outbound

This paper cites Test- time training with self-supervision for generalization under distribution shifts,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Test- time training with self-supervision for generalization under distribution shifts,

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:21.785630Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:05.375815Z digest=sha256:c51a0f67488dbf55b48624ce5902ef12b4efecbd71d64cb0ef23e54c2a841246

Observation 84dd50fd-d4c4-4f41-899a-8a87e855d20c · outbound

This paper cites Ttt++: When does self-supervised test-time training fail or thrive?.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Ttt++: When does self-supervised test-time training fail or thrive?

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:21.566451Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:05.448681Z digest=sha256:7fb05dbefbc2d831aa39232ebad08e142fa28b681deadd91e639553bdeba4353

Observation c10440b1-1872-475a-aafb-534383584764 · outbound

This paper cites Video test-time adaptation for action recognition,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Video test-time adaptation for action recognition,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:21.264182Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:05.518462Z digest=sha256:d9c3eb436491863513064a2eb77986f86f00fc6c3916725940c5fb5ea6d76ab4

Observation 39240480-f0e0-46aa-bf14-37bc0fb45207 · outbound

This paper cites Exploring motion cues for video test-time adaptation,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Exploring motion cues for video test-time adaptation,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:21.000344Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:05.610626Z digest=sha256:123edc05a046bf78af822395567a72d4754589533fd6f0e4874c873547c1dc51

Observation 868f3f2a-d989-4b31-9e57-31d4e654e113 · outbound

This paper cites Temporal coherent test time optimization for robust video classification,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Temporal coherent test time optimization for robust video classification,

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:20.721022Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:05.690630Z digest=sha256:e462523475261fb6ce24bfe20839882cb7ea56e734286699bfe136b8f78f356f

Observation 91fc1409-706e-4903-9822-ac82210290cd · outbound

This paper cites Ast: Audio spectrogram trans- former,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Ast: Audio spectrogram trans- former,

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:20.447973Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:05.784542Z digest=sha256:198fcfc7604b7051f889bf4d13a18c1200bfcb6de2c8ae82c0675f5b090bcbed

Observation b65251ea-1f18-4f5e-b089-cf9994bdeab2 · outbound

This paper cites Bert: Pre-training of deep bidirectional transformers for language understanding,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Bert: Pre-training of deep bidirectional transformers for language understanding,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:20.157611Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:05.838913Z digest=sha256:76852fd74c0b1d33704a308998f192a3dbe78661708cbfae103ba59b5b929464

Observation c4706b51-6c68-4ebd-8e0b-3fdcc501bc46 · outbound

This paper cites Language models are few-shot learners,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Language models are few-shot learners,

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:19.851606Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:05.948670Z digest=sha256:3d588903350585e68c83e3b467f1c5d950f1a1c758eca912e3c0eadf3726a637

Observation 70221e23-df80-470b-a2b2-58c44d3425b0 · outbound

This paper cites Benchmarking micro-action recognition: Dataset, methods, and applications,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Benchmarking micro-action recognition: Dataset, methods, and applications,

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T00:54:06.000889Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:54:06.000889Z digest=sha256:0593a1edb02b68e08fadac4467d337a1cd514ed38d873f4c6e6dc0cd118e58f3

Observation c6ff85e7-5055-4b09-a6ab-c043df2f96c8 · outbound

This paper cites Repetitive action counting with hybrid temporal relation modeling,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Repetitive action counting with hybrid temporal relation modeling,

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:19.626432Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:06.065746Z digest=sha256:ed8b760ad7e7636a48035027027dd67b07e52183cc7245f7f3ffec992726a7ff

Observation 7520c981-33b3-4f84-a967-38a94ee653a4 · outbound

This paper cites Prototypical Calibrating Ambiguous Samples for Micro-Action Recognition.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Prototypical Calibrating Ambiguous Samples for Micro-Action Recognition

Reference 22

Resolution
verified exact
local_arxiv, observed 2026-08-07T00:54:11.422232Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:06.134824Z digest=sha256:229df3238512d7e8e9eb7f8c887539cf2648ba0eb94f488aee225e6ec58caadf

Observation 178c1827-fb16-4470-8a43-a91f2e495c3a · outbound

This paper cites Test-time classifier adjustment module for model-agnostic domain generalization,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Test-time classifier adjustment module for model-agnostic domain generalization,

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:19.444206Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:06.202380Z digest=sha256:490fe46c4605ebd9ea10b3883dde72b108dd0642e8d89dc0c636fa293e51db24

Observation ef41e3dd-1d18-4f5b-b14e-bb2a1a9827a9 · outbound

This paper cites Revisiting realistic test-time training: Se- quential inference and adaptation by anchored clustering,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Revisiting realistic test-time training: Se- quential inference and adaptation by anchored clustering,

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:19.222262Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:06.281441Z digest=sha256:e673ea35fb27a9dc323cd846b8599a76a9e8cbead3289c78e9526bbd410939e5

Observation e7b9f108-df4e-422d-aee0-b29fe0e605e0 · outbound

This paper cites SITA: Single Image Test-time Adaptation.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation SITA: Single Image Test-time Adaptation

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T00:54:06.445024Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:54:06.445024Z digest=sha256:61e94218879ef7b4e7e5253e4b7f13ab45322f9ca7f4ef39786b95f40521d7b1

Observation 98665da7-8afb-46f2-85cd-083c4b518967 · outbound

This paper cites Parameter- free online test-time adaptation,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Parameter- free online test-time adaptation,

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:22.606696Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:06.515578Z digest=sha256:d0343e8a1dff4519a71397857c5e1ea3b74e1d5d41a1ffbc4caf5389d852f8e2

Observation d9f47279-cac6-4db3-ae65-aabd91af77d6 · outbound

This paper cites Camera-aware recurrent learn- ing and earth mover’s test-time adaption for generalizable person re- identification,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Camera-aware recurrent learn- ing and earth mover’s test-time adaption for generalizable person re- identification,

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:19.006423Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:06.595754Z digest=sha256:f5345072957218ce4cd00cdf46874c5fb9af01a85f105b57a443615de070e609

Observation 4af02cc9-a9bb-41b2-8a9f-5acf0a4dd16e · outbound

This paper cites Question type-aware debiasing for test-time visual question answering model adaptation,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Question type-aware debiasing for test-time visual question answering model adaptation,

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:18.793452Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:06.646156Z digest=sha256:c936c79bc40fdb7e279c54682a45b636b61fd0b8400c4a3dbcd4f75a038bafc6

Observation 426ef29f-b9f3-4086-95eb-a0d32b81d8f0 · outbound

This paper cites Ttagaze: Self- supervised test-time adaptation for personalized gaze estimation,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Ttagaze: Self- supervised test-time adaptation for personalized gaze estimation,

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:18.520748Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:06.746865Z digest=sha256:9d74c44d84b66298e196ccbc19187c387ab3e03789fbce60db204c1fa41d1866

Observation 174aeb4e-61c4-42e6-9455-24baaf35f24f · outbound

This paper cites What makes training multi-modal classification networks hard?.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation What makes training multi-modal classification networks hard?

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:18.232489Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:06.826776Z digest=sha256:4c30d2577cb7963c3b9c9bb777edfdec0e8d81596bbfaa0bacb653c59ab1f416

Observation 255777d1-a2c8-4efb-8993-09c7139213b3 · outbound

This paper cites Self-supervised learning by cross-modal audio-video cluster- ing,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Self-supervised learning by cross-modal audio-video cluster- ing,

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:17.967929Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:06.903443Z digest=sha256:8ae82f679eb89a0251792efc91f2e959e4251d64e56510219dde2fd5e4416551

Observation 32c2113e-0cb1-47d9-9873-d608507ab27e · outbound

This paper cites Look, listen and learn,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Look, listen and learn,

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T00:54:06.978167Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:54:06.978167Z digest=sha256:8ffccb859ad06bebf67d291f00017e67b692630aeabfeed059cb2130fe2f0665

Observation 91176f35-89b1-40de-9e1b-290dcc898439 · outbound

This paper cites Epic-fusion: Audio-visual temporal binding for egocentric action recognition,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Epic-fusion: Audio-visual temporal binding for egocentric action recognition,

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:17.726461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:07.054009Z digest=sha256:09a824615437486c70b86d7720af48761a97edfbca7bc657a7ebdd53c897bfb9

Observation 085ab076-13e7-4e6a-8a21-931541ac745c · outbound

This paper cites Exploring multimodal video representation for action recognition,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Exploring multimodal video representation for action recognition,

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:17.454728Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:07.124278Z digest=sha256:975ab0d391d975324ae38afdf452be7384502b103320be5eb36df287cbf98c18

Observation 23b8b71f-fc10-4aae-ae61-be9c24406bd2 · outbound

This paper cites Slowfast networks for video recognition,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Slowfast networks for video recognition,

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:17.205407Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:07.191632Z digest=sha256:3ccb54de42e8ad13648ff64e6b167110e4288477537227c86dcd19cadee7814e

Observation 6fd2c850-6ad3-497b-9e49-8f6d456f83a1 · outbound

This paper cites Attention is all you need,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Attention is all you need,

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:16.943553Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:07.258909Z digest=sha256:86861e8559106ddaf13248ba2a992b55af9af324587bf4ca1a80d136a553f4f2

Observation fb303fa4-2626-4463-a998-61c25ca33da5 · outbound

This paper cites Polyvit: Co-training vision transformers on images, videos and audio,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Polyvit: Co-training vision transformers on images, videos and audio,

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:16.667500Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:07.337614Z digest=sha256:04fd309b5e8150beb82871638bebe9b0d19ccc1e210ebf00c04ac85b10488bcb

Observation b16713c7-918d-429d-855c-720015e773d1 · outbound

This paper cites Attention bottlenecks for multimodal fusion,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Attention bottlenecks for multimodal fusion,

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:16.446415Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:07.455568Z digest=sha256:902891c74728468e8bf3bee92ec59c2f4823da91c9769c44f8a361d69b622a06

Observation dcf141e3-719f-4d7e-a95d-e6b3f163ad40 · outbound

This paper cites Mm-vit: Multi-modal video transformer for compressed video action recognition,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Mm-vit: Multi-modal video transformer for compressed video action recognition,

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:16.200539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:07.518122Z digest=sha256:981822284e2ebfc19c830aa14e0ae0ef2373510561ed3511e390ddee8183c69a

Observation e23503e9-c259-49d7-b4b0-9f13b0e6a016 · outbound

This paper cites Multimodal video summa- rization via time-aware transformers,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Multimodal video summa- rization via time-aware transformers,

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:15.879756Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:07.586329Z digest=sha256:3786e532e8696306ad1473f75906833cbb0e8884066de4b0c7a374376030e412

Observation 5bf451c0-f468-4d10-af81-edc6f728bcc2 · outbound

This paper cites Bootstrapping audio-visual video segmentation by strengthening audio cues,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Bootstrapping audio-visual video segmentation by strengthening audio cues,

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:15.684124Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:07.655498Z digest=sha256:70a8f045ea4429a83c1b03da01ba8b14f1c31237e6635627034a5fad2425da53

Observation 9bdd4f10-6020-4ed5-b822-df7c825746f8 · outbound

This paper cites Multimodal imbalance-aware gradient modulation for weakly-supervised audio-visual video parsing,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Multimodal imbalance-aware gradient modulation for weakly-supervised audio-visual video parsing,

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:15.364959Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:07.721031Z digest=sha256:67bd6daa485d22990a2e696b63c64df80fb50dd518895158cbc1a57e1afe8338

Observation 9d225224-9080-4aae-9bab-c8c718e3a678 · outbound

This paper cites Cross-Domain First Person Audio-Visual Action Recognition through Relative Norm Alignment.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Cross-Domain First Person Audio-Visual Action Recognition through Relative Norm Alignment

Reference 44

Resolution
verified exact
local_arxiv, observed 2026-08-07T00:54:11.168964Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:07.779728Z digest=sha256:f26a339007e950b35c3becfe279312f266d5c3d88ea3b631abb772b32723734b

Observation aad33de7-7250-4584-acf3-6102305d0e99 · outbound

This paper cites Domain generalization through audio-visual relative norm align- ment in first person action recognition,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Domain generalization through audio-visual relative norm align- ment in first person action recognition,

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:15.133343Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:07.851954Z digest=sha256:43c7206ce54184bc9dda84acec20098dca5a58d5f0ca8c545f7e9c4b8b574a03

Observation 59d7580c-d9ac-49f8-850d-120223135aa0 · outbound

This paper cites EPIC-KITCHENS-100 Unsupervised Domain Adaptation Challenge for Action Recognition 2021: Team M3EM Technical Report.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation EPIC-KITCHENS-100 Unsupervised Domain Adaptation Challenge for Action Recognition 2021: Team M3EM Technical Report

Reference 46

Resolution
verified exact
local_arxiv, observed 2026-08-07T00:54:10.875629Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:07.929631Z digest=sha256:e49e601125bff97b485842129614245065542d352ebed073f6af1e6ba002628b

Observation d358d349-6e20-44f5-a9dd-9e2524f5621e · outbound

This paper cites Audio-adaptive activity recognition across video domains,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Audio-adaptive activity recognition across video domains,

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:14.886959Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:07.986874Z digest=sha256:f8102d5024c738d891be581952507cb888f416509bf83352ee6841442fe73887

Observation 490a2777-9fd1-498a-b718-385ebbfdf2b5 · outbound

This paper cites Evaluating Prediction-Time Batch Normalization for Robustness under Covariate Shift.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Evaluating Prediction-Time Batch Normalization for Robustness under Covariate Shift

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T00:54:08.059471Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:54:08.059471Z digest=sha256:5551cdc50dce02a53f6b8fe46cdbe8af90f6fccbc78bae5e0f692471a06b3349

Observation 07ed5fe3-4fa2-4c93-9df1-22ac58be4d8f · outbound

This paper cites Do we really need to access the source data? source hypothesis transfer for unsupervised domain adaptation,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Do we really need to access the source data? source hypothesis transfer for unsupervised domain adaptation,

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:14.624959Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:08.145311Z digest=sha256:d9f9d349bc766e759f229c1cd74394177fbd18e2aa4875c6932940fec65ed0ea

Observation dc90267e-2b60-4a94-b076-e9ad0be78f72 · outbound

This paper cites Improving robustness against common corruptions by co- variate shift adaptation,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Improving robustness against common corruptions by co- variate shift adaptation,

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:14.417289Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:08.228981Z digest=sha256:2d83b45904c9e9fb87904e8fb61f680856d374d69e663e384aed4840038329ce

Observation d93c796a-0242-4373-beae-a396379c58d4 · outbound

This paper cites Entropy is not enough for test-time adaptation: From the perspective of disentangled factors,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Entropy is not enough for test-time adaptation: From the perspective of disentangled factors,

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:14.240539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:08.301199Z digest=sha256:2222391792dbd3096690001f7cc5cacdbce2bd31d3f48e0f490a8f4e85dc98d3

Observation 0476f983-fb1a-487f-b7f6-fdf12a861e8a · outbound

This paper cites Universal test-time adaptation through weight ensembling, diversity weighting, and prior correction,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Universal test-time adaptation through weight ensembling, diversity weighting, and prior correction,

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-07T00:54:08.407003Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:54:08.407003Z digest=sha256:473bb9d0033ac6c16a89b41632728283daf0eddb722e4173cf62700180d15a43

Observation e768709d-a74b-4c7f-a212-9d9dd48ce3f1 · outbound

This paper cites Audiovisual Moments in Time: A Large-Scale Annotated Dataset of Audiovisual Actions.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Audiovisual Moments in Time: A Large-Scale Annotated Dataset of Audiovisual Actions

Reference 53

Resolution
verified exact
local_arxiv, observed 2026-08-07T00:54:10.599730Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:08.481578Z digest=sha256:875189b8414d15ef90b8e2ff42d7fc46bf6e9184259de59dd2c898e77646838c

Observation 7c8791cc-cb44-4098-89e3-c7f0b9e6e398 · outbound

This paper cites Audio-visual event localization in unconstrained videos,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Audio-visual event localization in unconstrained videos,

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-07T00:54:08.563466Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:54:08.563466Z digest=sha256:135489ab5f72ed3827858b8d3ef8441eb727f1a03951731180b49982b2be805d

Observation b130993e-00e3-4e84-93ae-9c0080fb87fc · outbound

This paper cites Audio set: An ontology and human- labeled dataset for audio events,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Audio set: An ontology and human- labeled dataset for audio events,

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:14.034428Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:08.636158Z digest=sha256:90316c3361315b13f5aecf14ef5dc61413a05bdd5f8d3ec0efe2cc598c7e694e

Observation 36651001-5f58-4677-9828-bb06c1502279 · outbound

This paper cites UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-07T00:54:08.763811Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:54:08.763811Z digest=sha256:057de4179867fe652075aedc26036c560017e210412de478a208e62b7cb61c3a

Observation 3574da86-e5cc-46e9-8e52-1f40c592e625 · outbound

This paper cites The Kinetics Human Action Video Dataset.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation The Kinetics Human Action Video Dataset

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-07T00:54:08.874815Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:54:08.874815Z digest=sha256:75f2ad762af3e0dcd29339c7191a5f3218de525adddb9f6c268dbf8555eef4eb

Observation b8e4cf70-b82d-4853-8bd2-105440ec9aaf · outbound

This paper cites Large-scale robustness analysis of video action recognition models,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Large-scale robustness analysis of video action recognition models,

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:13.827545Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:09.001476Z digest=sha256:92bf48ac1e6b73c42d88566b0523db53ed2b95c7d2a777edf26148abf436bf4e

Observation 4e846e41-3dc4-440c-8be9-eb0aaa189ba4 · outbound

This paper cites Benchmarking the ro- bustness of spatial-temporal models against corruptions,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Benchmarking the ro- bustness of spatial-temporal models against corruptions,

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:13.597851Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:09.163831Z digest=sha256:41572273b015c5088d99c0f2cfe527830be4d58527750b78bc90eb0fb60a6cbc

Observation 2a2a7b6d-6b0b-4dd2-ab25-f9a9fc0582ef · outbound

This paper cites Tam: Temporal adaptive module for video recognition,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Tam: Temporal adaptive module for video recognition,

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:13.364637Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:09.279285Z digest=sha256:197f1ad013bcfd5d5e6a6065e4199b139c01bce88bf81b3e8bafe4cc7875c4dd

Observation 46ee0324-101f-42ee-aab1-47ce005d4311 · outbound

This paper cites Tsm: Temporal shift module for efficient video understanding,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Tsm: Temporal shift module for efficient video understanding,

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:13.073191Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:09.361593Z digest=sha256:5cfebd077c7be577ba142259546eeff44d32e4ad5a74963cb2321de37929a0de

Observation 87006b49-a61e-4ac3-9280-5a8f1af116ed · outbound

This paper cites Deep residual learning for image recognition,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Deep residual learning for image recognition,

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-07T00:54:09.442939Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:54:09.442939Z digest=sha256:3f298082da744b698ab5d527bbe26b5fb3ed89833a8e2acbd7d60ef200bcec29

Observation 63070090-db99-4110-ac56-e39954512b6b · outbound

This paper cites GPT-4 Technical Report.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation GPT-4 Technical Report

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-07T00:54:09.583647Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:54:09.583647Z digest=sha256:03a2cc080c3582cec499b18bc370858a748f747631c1bd92c06c58a88a561660

Observation 509beed8-46ef-43fc-b9db-5dcc97aeaea0 · outbound

This paper cites The claude 3 model family: Opus, sonnet, haiku.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation The claude 3 model family: Opus, sonnet, haiku

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:12.826462Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:09.675286Z digest=sha256:386a95f5a1f9309923b7c2a3b43c26801df250d11ee546e979eb4635dce2e46c

Observation 8f407caa-0ac6-4087-82e7-a198afb82056 · outbound

This paper cites The Llama 3 Herd of Models.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation The Llama 3 Herd of Models

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-07T00:54:09.790417Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:54:09.790417Z digest=sha256:2526ca54f8dfdf940891e0a56a82c328f30f2b3b78894c7f3826c5bfb4454f76

Observation ae8a3d41-acce-48ab-98aa-75f321b8c5bd · outbound

This paper cites Binggpt: Desktop application of new bing’s ai-powered chat,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Binggpt: Desktop application of new bing’s ai-powered chat,

Reference 66

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:12.566777Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:09.936000Z digest=sha256:c2ba80e6878f88f0328de02d40fe99ed7f7b470a830df394073c959977d49d06

Observation 11f5fe04-e0d2-4495-9474-6b730c5133c5 · outbound

This paper cites Audio mamba: Bidirectional state space model for audio representation learning,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Audio mamba: Bidirectional state space model for audio representation learning,

Reference 67

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:12.285855Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:10.052087Z digest=sha256:a662aacb5a39196cf9ef3f90359520be16bd3e7721b0f7c8c914774bbef6c55c

Observation 74beaab0-40bb-4086-b1e8-2dedecce1868 · outbound

This paper cites Beats: Audio pre-training with acoustic tokenizers,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Beats: Audio pre-training with acoustic tokenizers,

Reference 68

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:12.035490Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:10.186685Z digest=sha256:cb208f034a41372d37850db27d7efd60e6bc0ea446a12628c4b907c8f4e6f9e9

Observation 1976f334-fbb2-432d-bf83-acf962a6dd6f · outbound

This paper cites Tim: A time interval machine for audio-visual action recognition,.

Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation Tim: A time interval machine for audio-visual action recognition,

Reference 69

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:54:11.746977Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T00:54:10.310454Z digest=sha256:059eaf9d18a341dd72d63cff3af5728b99c57839b8fb53d6e5d1c446a489bba9

Pith citing papers

No inbound Pith citation observations are available.