{"as_of":"2026-08-18T18:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:01174471eac8ac3da9eeb551b8e9a313dccc6410abefddefca822ae2609c4e38","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:44:16.660639Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.12051/citation-record","integrity":"/paper/2505.12051/integrity","json":"/paper/2505.12051/citation-record.json","paper":"/paper/2505.12051"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:17.092854Z","title":"Hate begets hate: A temporal study of hate speech,","venue":null,"work_id":"13728cb1-62b7-453e-9fc9-a926292c9df0","year":2020},"citing_paper":{"arxiv_id":"2505.12051","last_updated":"2025-05-17T15:24:48Z","snapshot_observed_at":"2026-08-15T20:39:42.237462Z","submitted_at":"2025-05-17T15:24:48Z","title":"Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:16.534713Z"},"links":{"citing_paper":"/paper/2505.12051"},"observation_digest":"sha256:5de3ba663072366abde33560c69d07641dd158f94d013a3c07dec6e59726049a","observation_id":"066c9484-8849-4d45-b0cc-6496fc88dfb6","resolution":{"observed_at":"2026-08-15T20:44:17.097670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:17.078329Z","title":"You can’t stay here: The efficacy of reddit’s 2015 ban examined through hate speech,","venue":null,"work_id":"03ef4fdb-5c1d-4ed6-a097-f87af9a86dc7","year":2015},"citing_paper":{"arxiv_id":"2505.12051","last_updated":"2025-05-17T15:24:48Z","snapshot_observed_at":"2026-08-15T20:39:42.237462Z","submitted_at":"2025-05-17T15:24:48Z","title":"Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:16.539999Z"},"links":{"citing_paper":"/paper/2505.12051"},"observation_digest":"sha256:d34c2b6fd7cd9310cef143b778d8957f3096bf56fea7d8f8580f2101144caab2","observation_id":"1fcbd0d9-c8f2-4601-a083-5d5bf5cd0866","resolution":{"observed_at":"2026-08-15T20:44:17.083321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:17.056337Z","title":"Early prediction of hate speech propagation,","venue":null,"work_id":"4384b4a3-ae0f-46fb-84e4-a01d53ace258","year":2021},"citing_paper":{"arxiv_id":"2505.12051","last_updated":"2025-05-17T15:24:48Z","snapshot_observed_at":"2026-08-15T20:39:42.237462Z","submitted_at":"2025-05-17T15:24:48Z","title":"Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:16.543985Z"},"links":{"citing_paper":"/paper/2505.12051"},"observation_digest":"sha256:17a3148403c4feb83b8cc6b0a57fc6a6feb306bccfe8657183d43336db584fb2","observation_id":"ad8e5623-4b33-46c6-a5c3-2d6931bdddcf","resolution":{"observed_at":"2026-08-15T20:44:17.062907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:17.008478Z","title":"Hatemm: A multi-modal dataset for hate video classification,","venue":null,"work_id":"1243c57c-6bb7-406f-bb03-1ab6e805038f","year":2023},"citing_paper":{"arxiv_id":"2505.12051","last_updated":"2025-05-17T15:24:48Z","snapshot_observed_at":"2026-08-15T20:39:42.237462Z","submitted_at":"2025-05-17T15:24:48Z","title":"Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:16.547969Z"},"links":{"citing_paper":"/paper/2505.12051"},"observation_digest":"sha256:741be89d0477ffad9393e01a566325a7459c06905a888fd2be20b986edddf887","observation_id":"eb3d5fd8-9aac-468f-937e-071b434fe0aa","resolution":{"observed_at":"2026-08-15T20:44:17.020196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:16.552237Z","title":"Hate speech detection: Challenges and solutions,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.12051","last_updated":"2025-05-17T15:24:48Z","snapshot_observed_at":"2026-08-15T20:39:42.237462Z","submitted_at":"2025-05-17T15:24:48Z","title":"Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:16.552237Z"},"links":{"citing_paper":"/paper/2505.12051"},"observation_digest":"sha256:9f8dfdd6ae64b6dd588d3f73f9ee7457d8615c4deae5fdb36f91d16a0a30b40b","observation_id":"5e90f612-6436-43ad-8513-1169a762c191","resolution":{"observed_at":"2026-08-15T20:44:16.552237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:16.556058Z","title":"Deep learning for hate speech detection in tweets,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.12051","last_updated":"2025-05-17T15:24:48Z","snapshot_observed_at":"2026-08-15T20:39:42.237462Z","submitted_at":"2025-05-17T15:24:48Z","title":"Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:16.556058Z"},"links":{"citing_paper":"/paper/2505.12051"},"observation_digest":"sha256:87b6b45c06f860e8a7f85a71381ebd47fdfd286c02b6bf84c4b46ce481d8807c","observation_id":"b16f78d3-4e71-4e1c-b37e-89fe90490159","resolution":{"observed_at":"2026-08-15T20:44:16.556058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:16.980497Z","title":"Hate me, hate me not: Hate speech detection on face- book,","venue":null,"work_id":"709586db-3401-4666-aed0-e71906ef56f3","year":2017},"citing_paper":{"arxiv_id":"2505.12051","last_updated":"2025-05-17T15:24:48Z","snapshot_observed_at":"2026-08-15T20:39:42.237462Z","submitted_at":"2025-05-17T15:24:48Z","title":"Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:16.560524Z"},"links":{"citing_paper":"/paper/2505.12051"},"observation_digest":"sha256:c699a252b0dd8750555d7fbd17dfd19e40483a45871f7148d376b47ec7c858d5","observation_id":"6a1ce0e7-1bea-4ffa-b096-4767135708c3","resolution":{"observed_at":"2026-08-15T20:44:16.984437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:16.967147Z","title":"Understanding and detecting hateful content using contrastive learning,","venue":null,"work_id":"447d522f-09f6-4a09-a668-d53a21256f54","year":2023},"citing_paper":{"arxiv_id":"2505.12051","last_updated":"2025-05-17T15:24:48Z","snapshot_observed_at":"2026-08-15T20:39:42.237462Z","submitted_at":"2025-05-17T15:24:48Z","title":"Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:16.564983Z"},"links":{"citing_paper":"/paper/2505.12051"},"observation_digest":"sha256:5f40b22604c6072c6c3cb322646ed2f8c6ddd5c7a316ff77344147bd6b88fe0f","observation_id":"03a52ca4-073f-4d7b-b1fd-799c2041bc54","resolution":{"observed_at":"2026-08-15T20:44:16.971927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:16.569367Z","title":"The hateful memes challenge: Detecting hate speech in multimodal memes,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.12051","last_updated":"2025-05-17T15:24:48Z","snapshot_observed_at":"2026-08-15T20:39:42.237462Z","submitted_at":"2025-05-17T15:24:48Z","title":"Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:16.569367Z"},"links":{"citing_paper":"/paper/2505.12051"},"observation_digest":"sha256:33fbf60a8e620045b6cd5ec531b4cc837eb99238128c9564a691cf6135cb010f","observation_id":"a08a5f70-7d99-4386-bfb2-5d9982a559ef","resolution":{"observed_at":"2026-08-15T20:44:16.569367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:16.947388Z","title":"Detection of hate speech texts using machine learning algorithm,","venue":null,"work_id":"ff8b5597-9846-4103-a73d-566d48b5bf5e","year":2022},"citing_paper":{"arxiv_id":"2505.12051","last_updated":"2025-05-17T15:24:48Z","snapshot_observed_at":"2026-08-15T20:39:42.237462Z","submitted_at":"2025-05-17T15:24:48Z","title":"Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:16.573572Z"},"links":{"citing_paper":"/paper/2505.12051"},"observation_digest":"sha256:69e92eefa0a5b8c9f5fd58b7dd25cbe859588cc0c34eecbc6b3380c0feb761df","observation_id":"f9a0cd61-e0f5-4b2e-9f41-9d1e15e4634b","resolution":{"observed_at":"2026-08-15T20:44:16.951464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:16.934494Z","title":"Towards generalisable hate speech detection: a review on obstacles and solutions,","venue":null,"work_id":"a7acf3be-658a-496e-994c-0ee1e0ca8f8c","year":2021},"citing_paper":{"arxiv_id":"2505.12051","last_updated":"2025-05-17T15:24:48Z","snapshot_observed_at":"2026-08-15T20:39:42.237462Z","submitted_at":"2025-05-17T15:24:48Z","title":"Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:16.577320Z"},"links":{"citing_paper":"/paper/2505.12051"},"observation_digest":"sha256:6a6ea592df3391ef8694382276f642ed00177d38e6d7380420495152bb663141","observation_id":"8a48b8b9-7cce-4b7e-93ae-44f92530f371","resolution":{"observed_at":"2026-08-15T20:44:16.938528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.15606","last_updated":"2021-05-27T14:23:15Z","snapshot_observed_at":"2026-08-16T18:54:58.897868Z","submitted_at":"2020-12-31T13:44:56Z","title":"HateCheck: Functional Tests for Hate Speech Detection Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.15606","snapshot_observed_at":"2026-08-15T20:44:16.581302Z","title":"Hatecheck: Functional tests for hate speech detection models,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.12051","last_updated":"2025-05-17T15:24:48Z","snapshot_observed_at":"2026-08-15T20:39:42.237462Z","submitted_at":"2025-05-17T15:24:48Z","title":"Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:16.581302Z"},"links":{"cited_paper":"/paper/2012.15606","citing_paper":"/paper/2505.12051"},"observation_digest":"sha256:3c8bfa8c6ba95e3141b87761d48c4e9bf2e2bf4a1dcc4c07ff906a5cdfaa5e19","observation_id":"0bc0c4af-7a94-45e9-b4b9-b70830830b96","resolution":{"observed_at":"2026-08-15T20:44:16.581302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:16.921914Z","title":"All you need is","venue":null,"work_id":"c97306a5-befa-413f-85a1-0183b30fcd24","year":2018},"citing_paper":{"arxiv_id":"2505.12051","last_updated":"2025-05-17T15:24:48Z","snapshot_observed_at":"2026-08-15T20:39:42.237462Z","submitted_at":"2025-05-17T15:24:48Z","title":"Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:16.585770Z"},"links":{"citing_paper":"/paper/2505.12051"},"observation_digest":"sha256:ab86a4a1f9372ed7231c517b32806947e0445ce3419b6e882959873f4c82ce51","observation_id":"19de1005-a3f0-4007-ba9d-2c27ef48a9aa","resolution":{"observed_at":"2026-08-15T20:44:16.925654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:16.907578Z","title":"Exploring deep multimodal fusion of text and photo for hate speech classification,","venue":null,"work_id":"1fcc9d65-5db6-4e36-bb52-c1ff77ab18bb","year":2019},"citing_paper":{"arxiv_id":"2505.12051","last_updated":"2025-05-17T15:24:48Z","snapshot_observed_at":"2026-08-15T20:39:42.237462Z","submitted_at":"2025-05-17T15:24:48Z","title":"Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:16.589482Z"},"links":{"citing_paper":"/paper/2505.12051"},"observation_digest":"sha256:1630ae9f6a78eb2986f266f50c962783d4d2142a3771d7d2404d893d5eaa2762","observation_id":"d159d891-9ae5-4ccc-9c40-9957f18454be","resolution":{"observed_at":"2026-08-15T20:44:16.912654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:16.593704Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.12051","last_updated":"2025-05-17T15:24:48Z","snapshot_observed_at":"2026-08-15T20:39:42.237462Z","submitted_at":"2025-05-17T15:24:48Z","title":"Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:16.593704Z"},"links":{"citing_paper":"/paper/2505.12051"},"observation_digest":"sha256:099da9cb40a8042ef0e8ae7da4b329ad3247536400d82e738afb643dd25675c2","observation_id":"b0ac9bc6-8a17-4d60-9cbe-f0a32f610fb7","resolution":{"observed_at":"2026-08-15T20:44:16.593704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:16.885817Z","title":"Exploring hate speech detection in multimodal publications,","venue":null,"work_id":"d56408a6-7048-4b12-8a96-118991266646","year":2020},"citing_paper":{"arxiv_id":"2505.12051","last_updated":"2025-05-17T15:24:48Z","snapshot_observed_at":"2026-08-15T20:39:42.237462Z","submitted_at":"2025-05-17T15:24:48Z","title":"Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:16.598394Z"},"links":{"citing_paper":"/paper/2505.12051"},"observation_digest":"sha256:4318458c1fc3b688a88b83e416d79d5cd197e2de8b1945e92fb1d8adeb786360","observation_id":"16f86c24-a771-4274-9e8b-1eb6c329b09d","resolution":{"observed_at":"2026-08-15T20:44:16.891206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:16.873174Z","title":"Multimodal hate speech detection via multi-scale visual kernels and knowledge distillation architecture,","venue":null,"work_id":"d6d3ff92-f10a-4a99-ab90-3f41946e1024","year":2023},"citing_paper":{"arxiv_id":"2505.12051","last_updated":"2025-05-17T15:24:48Z","snapshot_observed_at":"2026-08-15T20:39:42.237462Z","submitted_at":"2025-05-17T15:24:48Z","title":"Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:16.602265Z"},"links":{"citing_paper":"/paper/2505.12051"},"observation_digest":"sha256:2afde1bdfe8c1943c88cbbaddceff48acc846545950074c5d4e74a5eaa03e107","observation_id":"3f8a2c54-8b74-4ae4-b01c-4d71e004b20b","resolution":{"observed_at":"2026-08-15T20:44:16.877369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:16.860596Z","title":"A social emotion classification approach using multi-model fusion,","venue":null,"work_id":"a66f2031-19e8-4a21-bd81-f72a7041daf7","year":2020},"citing_paper":{"arxiv_id":"2505.12051","last_updated":"2025-05-17T15:24:48Z","snapshot_observed_at":"2026-08-15T20:39:42.237462Z","submitted_at":"2025-05-17T15:24:48Z","title":"Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:16.606550Z"},"links":{"citing_paper":"/paper/2505.12051"},"observation_digest":"sha256:d4769d91e4365e306cef21ffbabb3c9ccc867cd39ad97a973813f33847bb0f46","observation_id":"5a32029d-3127-41a0-8951-553eee384732","resolution":{"observed_at":"2026-08-15T20:44:16.865168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02057","last_updated":"2020-10-05T14:46:20Z","snapshot_observed_at":"2026-08-16T19:15:48.485933Z","submitted_at":"2020-10-05T14:46:20Z","title":"Modulated Fusion using Transformer for Linguistic-Acoustic Emotion Recognition","version":1},"cited_work":{"arxiv_id":"2010.02057","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.02057","snapshot_observed_at":"2026-08-15T20:44:16.740920Z","title":"Modulated Fusion using Transformer for Linguistic-Acoustic Emotion Recognition","venue":"cs.CL","work_id":"8b942ee9-831b-44a4-9cda-16027c8af20c","year":2020},"citing_paper":{"arxiv_id":"2505.12051","last_updated":"2025-05-17T15:24:48Z","snapshot_observed_at":"2026-08-15T20:39:42.237462Z","submitted_at":"2025-05-17T15:24:48Z","title":"Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:16.610597Z"},"links":{"cited_paper":"/paper/2010.02057","citing_paper":"/paper/2505.12051"},"observation_digest":"sha256:12f199b93b08b2eae86087fcdafa349f71ad92dd41aec41d3efda1eba6cbee71","observation_id":"f65183d1-800c-4f56-a9a1-640e95f7749e","resolution":{"observed_at":"2026-08-15T20:44:16.747449Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:16.847127Z","title":"Detecting fake news on chinese social media based on hybrid feature fusion method,","venue":null,"work_id":"34f52d07-9ee4-4ca6-8c4d-f95151819b1b","year":2022},"citing_paper":{"arxiv_id":"2505.12051","last_updated":"2025-05-17T15:24:48Z","snapshot_observed_at":"2026-08-15T20:39:42.237462Z","submitted_at":"2025-05-17T15:24:48Z","title":"Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:16.614754Z"},"links":{"citing_paper":"/paper/2505.12051"},"observation_digest":"sha256:52417257d4855e126043bc3e3479a69073691216d816649ac1d91d99db62f7cc","observation_id":"df945bed-361d-40ad-81fc-324a13cebf2e","resolution":{"observed_at":"2026-08-15T20:44:16.851570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:16.834232Z","title":"Multi-feature fusion via hierarchical regression for multimedia anal- ysis,","venue":null,"work_id":"130b1498-0bf3-4511-8e50-e100e49380dc","year":2012},"citing_paper":{"arxiv_id":"2505.12051","last_updated":"2025-05-17T15:24:48Z","snapshot_observed_at":"2026-08-15T20:39:42.237462Z","submitted_at":"2025-05-17T15:24:48Z","title":"Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:16.618736Z"},"links":{"citing_paper":"/paper/2505.12051"},"observation_digest":"sha256:b4fb9bee9a21db75a4da915d86ffed102d84647ea5c7c8582261d29d2d560981","observation_id":"85c4056e-4278-429e-82ff-4b92748ad9e4","resolution":{"observed_at":"2026-08-15T20:44:16.838476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:16.821482Z","title":"Visual and textual deep feature fusion for document image classification,","venue":null,"work_id":"fffb194b-d6bc-4ee1-b763-71c3bf7eda4b","year":2020},"citing_paper":{"arxiv_id":"2505.12051","last_updated":"2025-05-17T15:24:48Z","snapshot_observed_at":"2026-08-15T20:39:42.237462Z","submitted_at":"2025-05-17T15:24:48Z","title":"Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:16.622341Z"},"links":{"citing_paper":"/paper/2505.12051"},"observation_digest":"sha256:a15222836e16b5934db981a9c83b5159ea43a6a2fd1ba7b2906e48a691122df7","observation_id":"ba4d12f9-b980-45bb-a229-30ceee9ed06a","resolution":{"observed_at":"2026-08-15T20:44:16.826064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:16.808286Z","title":"A practical tutorial on autoencoders for nonlinear feature fusion: Taxon- omy, models, software and guidelines,","venue":null,"work_id":"9dd14a3e-39b8-4ff9-acaa-57c4aafd42e3","year":2018},"citing_paper":{"arxiv_id":"2505.12051","last_updated":"2025-05-17T15:24:48Z","snapshot_observed_at":"2026-08-15T20:39:42.237462Z","submitted_at":"2025-05-17T15:24:48Z","title":"Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:16.626360Z"},"links":{"citing_paper":"/paper/2505.12051"},"observation_digest":"sha256:ad0e8a5e25594d8bcb6a88c4a4b38a5ca15de1571ba4d013b991bd16021e45c2","observation_id":"886d757e-31a7-4af3-af09-21a4d79fdc2f","resolution":{"observed_at":"2026-08-15T20:44:16.813017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:16.793317Z","title":null,"venue":null,"work_id":"382f7626-712f-4e18-b2ab-154dc7a650c9","year":2024},"citing_paper":{"arxiv_id":"2505.12051","last_updated":"2025-05-17T15:24:48Z","snapshot_observed_at":"2026-08-15T20:39:42.237462Z","submitted_at":"2025-05-17T15:24:48Z","title":"Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:16.630628Z"},"links":{"citing_paper":"/paper/2505.12051"},"observation_digest":"sha256:692420686593a8890e41bf35dd965d2b5c8cd811c7620210125889599f32043e","observation_id":"14757439-fed6-413a-8188-f6b229d8b450","resolution":{"observed_at":"2026-08-15T20:44:16.798170Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:16.635855Z","title":"Robust speech recognition via large-scale weak supervi- sion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12051","last_updated":"2025-05-17T15:24:48Z","snapshot_observed_at":"2026-08-15T20:39:42.237462Z","submitted_at":"2025-05-17T15:24:48Z","title":"Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:16.635855Z"},"links":{"citing_paper":"/paper/2505.12051"},"observation_digest":"sha256:442032d6f15ec116c80fa05c823044d6106fdf7bc464bbc060ab97d1f29a89fa","observation_id":"e07fa401-2fe5-4d0f-922d-3b606b783893","resolution":{"observed_at":"2026-08-15T20:44:16.635855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-15T20:44:16.639583Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.12051","last_updated":"2025-05-17T15:24:48Z","snapshot_observed_at":"2026-08-15T20:39:42.237462Z","submitted_at":"2025-05-17T15:24:48Z","title":"Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:16.639583Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.12051"},"observation_digest":"sha256:20331bde86e343f21e71bfdd9816e5ef739aa5ecb7005f88dc3744fffea63cdc","observation_id":"dfee4084-871c-4843-b48f-626801321707","resolution":{"observed_at":"2026-08-15T20:44:16.639583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1003.4083","last_updated":"2010-03-22T06:39:55Z","snapshot_observed_at":"2026-08-17T15:09:40.961774Z","submitted_at":"2010-03-22T06:39:55Z","title":"Voice Recognition Algorithms using Mel Frequency Cepstral Coefficient (MFCC) and Dynamic Time Warping (DTW) Techniques","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1003.4083","snapshot_observed_at":"2026-08-15T20:44:16.644034Z","title":"V oice recognition algorithms using mel frequency cepstral coefficient (mfcc) and dynamic time warping (dtw) techniques,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.12051","last_updated":"2025-05-17T15:24:48Z","snapshot_observed_at":"2026-08-15T20:39:42.237462Z","submitted_at":"2025-05-17T15:24:48Z","title":"Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:16.644034Z"},"links":{"cited_paper":"/paper/1003.4083","citing_paper":"/paper/2505.12051"},"observation_digest":"sha256:d7b5de5631f57cc521e2463e15e0b5f61d29b74508aa146b4641561cc3940a5b","observation_id":"44e71b19-f685-43e8-88bc-96f0e43a0430","resolution":{"observed_at":"2026-08-15T20:44:16.644034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:16.648422Z","title":"Squeeze-and-excitation networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.12051","last_updated":"2025-05-17T15:24:48Z","snapshot_observed_at":"2026-08-15T20:39:42.237462Z","submitted_at":"2025-05-17T15:24:48Z","title":"Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:16.648422Z"},"links":{"citing_paper":"/paper/2505.12051"},"observation_digest":"sha256:432642f43aeece6bde62897c751e455e790b5b3ae38eb6334372836d36a791a2","observation_id":"346bfa8b-c691-497b-8160-3f78e4baa911","resolution":{"observed_at":"2026-08-15T20:44:16.648422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-15T20:44:16.652686Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.12051","last_updated":"2025-05-17T15:24:48Z","snapshot_observed_at":"2026-08-15T20:39:42.237462Z","submitted_at":"2025-05-17T15:24:48Z","title":"Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:16.652686Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2505.12051"},"observation_digest":"sha256:9ddd8ddc973cc6f00ff844d69e062261fe375b9a2f409f6243fa1f1b3ea80c3d","observation_id":"04fb1ae2-9ccb-4fa4-bd26-c56b5308990d","resolution":{"observed_at":"2026-08-15T20:44:16.652686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:16.656815Z","title":"Language mod- els are few-shot learners,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.12051","last_updated":"2025-05-17T15:24:48Z","snapshot_observed_at":"2026-08-15T20:39:42.237462Z","submitted_at":"2025-05-17T15:24:48Z","title":"Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:16.656815Z"},"links":{"citing_paper":"/paper/2505.12051"},"observation_digest":"sha256:59d55270d55c6a9f0ea3c9dc13349df81e91c7f54ec9efbddbb17e03161e5263","observation_id":"022408d4-5b7f-41ac-b107-8d0ec46ba297","resolution":{"observed_at":"2026-08-15T20:44:16.656815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.03426","last_updated":"2020-09-18T01:56:41Z","snapshot_observed_at":"2026-08-02T15:32:07.466568Z","submitted_at":"2018-02-09T19:39:33Z","title":"UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.03426","snapshot_observed_at":"2026-08-15T20:44:16.660639Z","title":"Umap: Uniform manifold approximation and projection for dimension reduction,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.12051","last_updated":"2025-05-17T15:24:48Z","snapshot_observed_at":"2026-08-15T20:39:42.237462Z","submitted_at":"2025-05-17T15:24:48Z","title":"Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:16.660639Z"},"links":{"cited_paper":"/paper/1802.03426","citing_paper":"/paper/2505.12051"},"observation_digest":"sha256:91964820986f7791ce0368a33f461cb1ddec962ad27f00202ffac44c99ebaada","observation_id":"40fb30f4-0f6e-424d-841c-dec50513c52e","resolution":{"observed_at":"2026-08-15T20:44:16.660639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.12051","last_updated":"2025-05-17T15:24:48Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-15T20:39:42.237462Z","submitted_at":"2025-05-17T15:24:48Z","title":"Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":1,"verified_fuzzy":17},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2505.12051."}