{"as_of":"2026-08-09T13:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d14fdfb1612cde1b1b4999b2124be87a0784d4aec49bcb2baa81d65ab93e2b71","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:03:03.579463Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.09323/citation-record","integrity":"/paper/2507.09323/integrity","json":"/paper/2507.09323/citation-record.json","paper":"/paper/2507.09323"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.017550Z","title":"Vatt: Transformers for multimodal self-supervised learning from raw video, audio and text","venue":null,"work_id":"c703a986-0935-4997-a77a-12226b16bb2e","year":2021},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-08T11:34:00.470309Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:02.905926Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:4b09270251952dba051a89bb91d78eb027a02889495e88aeae1fc6e6a597dd19","observation_id":"81fd07c6-b149-4500-99ae-b80d39c05c51","resolution":{"observed_at":"2026-08-06T18:03:04.021804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.003866Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"d860f575-04aa-4d20-a968-df581a7e683f","year":2022},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-08T11:34:00.470309Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:02.983484Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:9468a71fabe38af154dc8c635594922e149b21daf93156137317b8b1101eefbb","observation_id":"cefb466b-5949-46af-bcea-ebb65e9331cc","resolution":{"observed_at":"2026-08-06T18:03:04.007900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.989470Z","title":"Multimodal machine learning: A survey and tax- onomy","venue":null,"work_id":"b8fcdbe3-8d9f-4cc2-96f0-64f51595f1af","year":2019},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-08T11:34:00.470309Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.160526Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:d7bb36fe2cc29a7029e87f3eb867711e6e74e1ef9012bad49632483dad15d2ef","observation_id":"b0797321-987a-43db-877a-5e0851227593","resolution":{"observed_at":"2026-08-06T18:03:03.994738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.975917Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"fd4c99c4-6bb2-4c78-89b5-1c0916b7c596","year":2020},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-08T11:34:00.470309Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.298243Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:48e2cdb78bff290110097e6d65a55e3257d706456fe4dcfcdf42bf7b1ed4311c","observation_id":"8ee51abf-9a5d-485d-9cd4-b7c4d669e9d0","resolution":{"observed_at":"2026-08-06T18:03:03.980373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.961567Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":"203def2e-abcf-4a9d-8364-6e737575e624","year":2020},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-08T11:34:00.470309Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.420105Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:d8239dc912cf5606f4c201d62064bbb7b1341c22a95c4e67e8f8c4e912d8c4f1","observation_id":"7537496e-dbc4-4ce6-b0a8-25fb935740eb","resolution":{"observed_at":"2026-08-06T18:03:03.965880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.946494Z","title":"Scaling egocentric vision: The epic-kitchens dataset","venue":null,"work_id":"a0769a54-906e-4933-a467-0de8bea80938","year":2018},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-08T11:34:00.470309Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.475163Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:ee79052a51a37c92f219cca2d8a7dd5ab427e942573661c664991c47e3f721d7","observation_id":"87a38546-9c25-4da7-b423-bcd7692e4e77","resolution":{"observed_at":"2026-08-06T18:03:03.951067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.932425Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"c4ca6549-8629-41ca-8b7a-1ad8c36af49d","year":2020},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-08T11:34:00.470309Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.480607Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:8f439c4d75e4384e80699b5b0bd78d35ba2cc08c483ff35551344069ddaa7811","observation_id":"08276ac1-58f2-4dcf-be21-fe5fceb7038d","resolution":{"observed_at":"2026-08-06T18:03:03.936862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.01595","last_updated":"2020-05-29T01:30:14Z","snapshot_observed_at":"2026-08-09T07:54:13.902466Z","submitted_at":"2020-05-29T01:30:14Z","title":"Large Scale Audiovisual Learning of Sounds with Weakly Labeled Data","version":1},"cited_work":{"arxiv_id":"2006.01595","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.01595","snapshot_observed_at":"2026-08-06T18:03:03.681222Z","title":"Large Scale Audiovisual Learning of Sounds with Weakly Labeled Data","venue":"eess.AS","work_id":"28442f5c-ecba-430b-b49a-9790ada03f3d","year":2020},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-08T11:34:00.470309Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.485282Z"},"links":{"cited_paper":"/paper/2006.01595","citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:98e17780aed1bb0a1c4d0e9e219cfc49d54172f1133006dc1acff529412dd6b7","observation_id":"cda91782-4f55-477d-a412-4ffe5229e882","resolution":{"observed_at":"2026-08-06T18:03:03.685469Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.918507Z","title":"Audio set: An ontology and human- labeled dataset for audio events","venue":null,"work_id":"e2590733-9c68-4fa2-8e71-1906b47173d1","year":2017},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-08T11:34:00.470309Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.490036Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:835acc73f029a7138cab92a6bbe8298279fba8693dbcfc34208324d1d7827dc9","observation_id":"db469e9c-eab5-497f-84ec-e9d938026c04","resolution":{"observed_at":"2026-08-06T18:03:03.922445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.905458Z","title":"Audiovisual masked autoencoders","venue":null,"work_id":"6bff47fb-8693-45e6-b9df-a35442ade275","year":null},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-08T11:34:00.470309Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.494154Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:e27603e72d8c09397a8cc311e98653931da80f6040f0f811fe5d4050dff1b2a5","observation_id":"13d93ebc-8506-4e7e-ac6c-8d0f6ba74705","resolution":{"observed_at":"2026-08-06T18:03:03.909656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-06T18:03:03.498534Z","title":"Ast: Audio spectrogram transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-08T11:34:00.470309Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.498534Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:cb799b1ab0ca6c403b967077cf361a81f0d767cab3a5afc9fd6d0b39b90d8049","observation_id":"8eeb24fa-c3e4-4bf2-bce0-6e3ca5a37666","resolution":{"observed_at":"2026-08-06T18:03:03.498534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.892528Z","title":"Uavm: Towards unifying audio and visual models","venue":null,"work_id":"a3f98d61-52e9-4c3e-ae84-b418e6b31092","year":null},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-08T11:34:00.470309Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.503076Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:9a495be316d60f9e97e5fbb80599eb4e654da5c8ad2b5253a9564d0cb1401277","observation_id":"75677a28-1a87-4e6a-8b4c-a88b97687b0e","resolution":{"observed_at":"2026-08-06T18:03:03.896484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07839","last_updated":"2023-04-11T22:47:19Z","snapshot_observed_at":"2026-07-06T14:05:23.547010Z","submitted_at":"2022-10-02T07:29:57Z","title":"Contrastive Audio-Visual Masked Autoencoder","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07839","snapshot_observed_at":"2026-08-06T18:03:03.507305Z","title":"Contrastive audio-visual masked autoencoder.arXiv preprint arXiv:2210.07839, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-08T11:34:00.470309Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.507305Z"},"links":{"cited_paper":"/paper/2210.07839","citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:417d4ffbf2317e74c9b965fa72a067669e25b70f4eec18ad587688f206a06a2b","observation_id":"8696b57a-3e26-4303-8f96-eccab980b3f1","resolution":{"observed_at":"2026-08-06T18:03:03.507305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.511781Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-08T11:34:00.470309Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.511781Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:da7f48c982bc51cf749481190de239e8d7a00e9a1562b600eca2bd1b98aa673e","observation_id":"43fe541e-1486-4185-b0fb-1a857cf9e9d8","resolution":{"observed_at":"2026-08-06T18:03:03.511781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.871685Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units","venue":null,"work_id":"26436529-f284-45bb-926e-629fd7736eda","year":2021},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-08T11:34:00.470309Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.515621Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:012e8234a457c4ebae4aa9ee363a9f2e348ed5ab43a8682144ee4f68eeb4fea8","observation_id":"34a4a523-6847-4011-a690-2d8c5743b512","resolution":{"observed_at":"2026-08-06T18:03:03.875713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.858566Z","title":"Perceiver io: A general architecture for structured inputs & outputs","venue":null,"work_id":"e1b9da7a-11c4-421a-be83-f1fb19e32c05","year":2021},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-08T11:34:00.470309Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.519693Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:43126128f3ce6a32e1b59a3ba8daa5f716f77a92ecd664a62dcde14a2c873a74","observation_id":"66f5017d-ab57-4e8a-9d3d-ba3f78cce6a2","resolution":{"observed_at":"2026-08-06T18:03:03.862821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.523260Z","title":"Supervised contrastive learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-08T11:34:00.470309Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.523260Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:08aaa2203eced6d170a001ca594f6e17700f7f97c2dcb9164e3c54f2872848e8","observation_id":"9fd1149d-b653-4743-b5b1-1c9cda6cd8de","resolution":{"observed_at":"2026-08-06T18:03:03.523260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.835739Z","title":"Kipf and Max Welling","venue":null,"work_id":"ba18600e-c9cd-4081-896c-ad6946c72d95","year":2017},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-08T11:34:00.470309Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.527353Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:c3d9865932aeec8b1c246c6a8ed8cef17733478c4d0a8110b9d6ba13bf99998c","observation_id":"3dfc1e15-bec4-4adf-9842-a7c36837af65","resolution":{"observed_at":"2026-08-06T18:03:03.840950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.531207Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-08T11:34:00.470309Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.531207Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:0206a0dc824a86f2e39f65f731b37eddc288950c02df9d9e1809064411873b6b","observation_id":"91f8c0f3-0761-4cd8-88b6-c75018c4447e","resolution":{"observed_at":"2026-08-06T18:03:03.531207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.813771Z","title":"Attention bottlenecks for multimodal fusion","venue":null,"work_id":"e41b7948-8a37-4a22-8115-a928f1468e21","year":2021},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-08T11:34:00.470309Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.534986Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:0fcdbee731bb2abd7a35138edc68c2f86ca1aaa54c2061edab48c24e6b1e820f","observation_id":"8884ea43-29e0-40e3-97c3-353b84b113d4","resolution":{"observed_at":"2026-08-06T18:03:03.817741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.07804","last_updated":"2020-07-03T09:59:06Z","snapshot_observed_at":"2026-08-02T14:05:53.425649Z","submitted_at":"2019-07-17T22:59:56Z","title":"OmniNet: A unified architecture for multi-modal multi-task learning","version":2},"cited_work":{"arxiv_id":"1907.07804","doi":null,"metadata_source":"pith","pith_arxiv_id":"1907.07804","snapshot_observed_at":"2026-08-06T18:03:03.629279Z","title":"OmniNet: A unified architecture for multi-modal multi-task learning","venue":"cs.LG","work_id":"c74699d5-2aa0-400e-8403-2a2d87ec8377","year":2019},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-08T11:34:00.470309Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.538749Z"},"links":{"cited_paper":"/paper/1907.07804","citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:0ddbf972ac0f3173117f7ce8330da2d893dd354a37e2c80a5986626623a1e38b","observation_id":"d8e499b7-5b22-433e-a139-d600351e428f","resolution":{"observed_at":"2026-08-06T18:03:03.635985Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.799360Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":"49097a25-9818-4694-ae4c-a6b44f2afd25","year":2023},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-08T11:34:00.470309Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.542837Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:65ff6f0c96663965339a2740b00fed6615a29269f32d0f3ea183c536faf0a8d0","observation_id":"cbb55465-42fc-4aad-af02-d8caa9f7e5b2","resolution":{"observed_at":"2026-08-06T18:03:03.804017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.785110Z","title":"Multimodal fusion for audio-image and video action recognition","venue":null,"work_id":"2cdd95f1-c13d-48ad-8fbb-4dce8253414f","year":2024},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-08T11:34:00.470309Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.546642Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:94b585b7e48a74fac35dfb126d2c96e2d91336963f30b8dbbb91232963594856","observation_id":"45308ca1-9e25-49cf-8ec7-039260699ba7","resolution":{"observed_at":"2026-08-06T18:03:03.789208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-06T18:03:03.550744Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-08T11:34:00.470309Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.550744Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:9fdbc0574efc1dd8e8e4eab7b3c489214f680cccd819737d8ced6f6f30ee5915","observation_id":"93092bbe-2d4a-4d8b-9715-0b47c7270d60","resolution":{"observed_at":"2026-08-06T18:03:03.550744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.771819Z","title":"Omnivec: Learn- ing robust representations with cross modal sharing","venue":null,"work_id":"8b5fb2e4-50a3-441a-b6fa-d9c27b531631","year":2024},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-08T11:34:00.470309Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.555128Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:b004a9eb3456be80b951b619b7dfac55668d588296481d7a25f7ddbfcbe87251","observation_id":"69247b40-9d48-4fe2-82f4-5a69517c00d3","resolution":{"observed_at":"2026-08-06T18:03:03.776085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.758251Z","title":"One-peace: Ex- ploring one general representation model toward unlimited modalities","venue":null,"work_id":"480f4821-ed31-4c13-9afe-6ccf3ea4e9d6","year":2023},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-08T11:34:00.470309Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.559513Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:428524d0b351aca0559b8fb47d896f6817d7dbf11b374b271a69b1219174a74f","observation_id":"43b5864b-2380-435f-9838-5310b5699aad","resolution":{"observed_at":"2026-08-06T18:03:03.762263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.745402Z","title":"What makes train- ing multi-modal classification networks hard? In Proceed- ings of the IEEE/CVF conference on computer vision and pattern recognition, pages 12695–12705, 2020","venue":null,"work_id":"8cf452f4-1812-4f40-8f75-124a949fde02","year":2020},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-08T11:34:00.470309Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.563766Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:be1a04959a7fde2a85c7e5788ce5d6bb2ae069fc9eb1502c38223d81432db204","observation_id":"7db7b7c4-35da-46b2-9112-372c202ae259","resolution":{"observed_at":"2026-08-06T18:03:03.749426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.731829Z","title":"Multi-stream multi-class fusion of deep net- works for video classification","venue":null,"work_id":"f0f01811-e38d-46d9-b526-b1447d405ace","year":2016},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-08T11:34:00.470309Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.567838Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:710e43fdfd7e7070b1bd5ece818076c400d266737eb74c1d1682b4759a54c038","observation_id":"1ee6d336-c67d-4573-95c9-601d530a2871","resolution":{"observed_at":"2026-08-06T18:03:03.736313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.571745Z","title":"Multimodal learning with transformers: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-08T11:34:00.470309Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.571745Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:ad1930a41fa8256c4ac5a9c6b95a63ebec962b22ad75bf96bc8d8661bf8b0a0e","observation_id":"430b57eb-fd29-4b5e-a891-bc128515017a","resolution":{"observed_at":"2026-08-06T18:03:03.571745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.708929Z","title":"Peters, and Yejin Choi","venue":null,"work_id":"858d9a05-bda3-4668-ba9b-6f37b30eea80","year":2021},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-08T11:34:00.470309Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.575757Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:d174ea30fa8d895181df8179a4c840da610edd4c1b85dc7decb35723f697f8c6","observation_id":"386e133a-4d35-425b-b3ee-13d6a532b2b8","resolution":{"observed_at":"2026-08-06T18:03:03.712763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.695095Z","title":"Multimodal representation learning: Advances, trends and challenges","venue":null,"work_id":"7623a681-ac7f-4da7-9962-599b517a9ef7","year":2019},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-08T11:34:00.470309Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.579463Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:af7bd6ca039a3497cdc8b8443e54b9f2b74095de677ce23bcd351c3530197117","observation_id":"43cce9bc-5253-4dba-a12c-ba2f1337c6fd","resolution":{"observed_at":"2026-08-06T18:03:03.699421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T11:34:00.470309Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":2,"verified_fuzzy":22},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2507.09323."}