{"as_of":"2026-08-12T04:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9c16e9e0d180ac1fc6e14fbdb421af8cb0c4f3388fa34dcdc79986163e834a4f","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:18:32.900270Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:42:33.784811Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T06:41:37.028986Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.03722","snapshot_observed_at":"2026-08-06T11:42:33.784811Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.03728","last_updated":"2025-07-30T07:51:42Z","snapshot_observed_at":"2026-08-06T11:42:27.212497Z","submitted_at":"2025-07-30T07:51:42Z","title":"WINELL: Wikipedia Never-Ending Updating with LLM Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T11:42:33.784811Z"},"links":{"cited_paper":"/paper/2508.03722","citing_paper":"/paper/2508.03728"},"observation_digest":"sha256:324cfbc896995ac36dd4ad21206b179d98e93806a7c2f76a0eefbdf1143c3a8e","observation_id":"6a5087e3-3222-4fec-a5e0-b7b40d215aa8","resolution":{"observed_at":"2026-08-06T11:42:33.784811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"cited_work":{"arxiv_id":"2508.03722","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.03722","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","venue":null,"work_id":"8395c3df-ed9f-45fa-b19f-ffb635833b1b","year":2025},"citing_paper":{"arxiv_id":"2605.10404","last_updated":"2026-05-11T11:42:43Z","snapshot_observed_at":"2026-08-12T03:26:12.762821Z","submitted_at":"2026-05-11T11:42:43Z","title":"Position: Life-Logging Video Streams Make the Privacy-Utility Trade-off Inevitable","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-12T04:03:38.659547Z"},"links":{"cited_paper":"/paper/2508.03722","citing_paper":"/paper/2605.10404"},"observation_digest":"sha256:a3cf6cd403b026cbd7a8dbfda7c455c6db5b5f011dc09d03f0a00d06f8f177d5","observation_id":"4134853e-9692-4730-a6db-6da003818775","resolution":{"observed_at":"2026-05-12T06:41:37.038342Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.03722/citation-record","integrity":"/paper/2508.03722/integrity","json":"/paper/2508.03722/citation-record.json","paper":"/paper/2508.03722"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T12:18:29.677235Z","title":"Deepseek-r1: Incen- tivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:29.677235Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:da429d3ba88a668e0307ac31db075951736f7a4c67dd0ae9ebaf126c24552787","observation_id":"8d5c627a-a6db-43ee-a226-5bb0c96c6d11","resolution":{"observed_at":"2026-08-06T12:18:29.677235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-06T12:18:29.724352Z","title":"Miranda, Alisa Liu, Nouha Dziri, Shane Lyu, Yuling Gu, Saumya Malik, Victoria Graf, Jena D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:29.724352Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:7153a34266865728b5929b86791599620ad6dd840a92be224fb1567b01c8e46b","observation_id":"4eb8c3b6-26c8-493a-b570-d4b6c0db845e","resolution":{"observed_at":"2026-08-06T12:18:29.724352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:29.763895Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:29.763895Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:e2ea8fa65882c5e724eb1f423bc94020e1a8cbeef66d2f061f164b373e90c8d4","observation_id":"efd91f36-55f8-451b-912c-67610fb9ae5e","resolution":{"observed_at":"2026-08-06T12:18:29.763895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:37.941566Z","title":"Train- ing language models to follow instructions with human feedback","venue":null,"work_id":"44616b7a-35a0-46b9-a062-296fa4c0dcd2","year":2022},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:29.858380Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:c2bcd688467ebbd492a17d11250d7df1d9ee8f43722b5c6bfeebac760a9f967c","observation_id":"23b59b22-e7a1-4a78-8c88-f34c8c64a3e5","resolution":{"observed_at":"2026-08-06T12:18:38.079998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T12:18:29.911747Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:29.911747Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:dd1c7ff3c9e22f528bf146f7a7beb8f4a663403a8499561c81c2f5961a70703b","observation_id":"8206c12d-31a4-40cd-8a65-113b73225169","resolution":{"observed_at":"2026-08-06T12:18:29.911747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2407.18552","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:33.684576Z","title":"R., Shravan Venkatraman, Vigya Sharma, Santhosh Malarvannan, and Modigari Narendra","venue":null,"work_id":"27001004-a457-4abf-848d-f9ac4e031688","year":2025},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:29.965395Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:4b87a333a42b53350ae6017b0ce19d6824ab64171f9370bbf0ceb57f3c5292fd","observation_id":"407afac2-5f17-40be-adcf-141bf72293d0","resolution":{"observed_at":"2026-08-06T12:18:33.807166Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:37.712013Z","title":"Tacfn: Transformer-based adaptive cross-modal fusion network for multimodal emotion recognition.Artificial Intelligence Research, 2, 2023","venue":null,"work_id":"67a755fc-76cf-4269-8e85-f221f736af9d","year":2023},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:30.052923Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:fec1ffd8b259941d2d2518987d114cbc2ed4c67f214b110f8ac588bf5bd0605e","observation_id":"8bee82be-d806-41f9-a2a2-d50e6b8b2026","resolution":{"observed_at":"2026-08-06T12:18:37.820936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:37.508201Z","title":"Multimodal language analysis in the wild: CMU-MOSEI dataset and interpretable dynamic fusion graph","venue":null,"work_id":"a7e2d439-504e-4fc6-b2fd-5200627d7ef1","year":2018},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:30.152705Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:696703d3c8ee377433b8025bd20493b5197dae08e07e376004816e69467cece7","observation_id":"74b3c003-b1f4-4aff-bef3-b35b768feb6d","resolution":{"observed_at":"2026-08-06T12:18:37.576873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:37.268636Z","title":"Livingstone and Frank A","venue":null,"work_id":"1c53e230-ae98-4442-8672-1e12ad723acd","year":2018},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:30.207137Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:037f70c886408c0a20a5ad09e5adb4ecd480c37efb34905305b993b1d9a4a2e4","observation_id":"08dc0430-9e1c-4952-8d6f-886f58d8298d","resolution":{"observed_at":"2026-08-06T12:18:37.377872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:37.052131Z","title":"Multimodal emotion recognition with vision–language prompting and modality dropout","venue":null,"work_id":"2d77deb3-a9c3-49c1-a65c-1ecc386ac3ab","year":2024},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:30.303597Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:3687c330f9ff6b0eb8efc885da630d404b7f0c17aae9c1d72b06fbd32015142c","observation_id":"23f35a65-b2f2-4331-855f-2cd9752c836f","resolution":{"observed_at":"2026-08-06T12:18:37.178312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:36.838095Z","title":"Visual and textual prompts for enhancing emotion recognition in video","venue":null,"work_id":"8cc6ed6c-7c0b-432d-afd7-4166541062b0","year":2024},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:30.454122Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:5b52435b3bf1f73d72946a66c63fdaa731e196b64ff94f6eec145d2c54d2f4a6","observation_id":"fd14d689-c8ec-4d1b-81ad-326227f8d045","resolution":{"observed_at":"2026-08-06T12:18:36.927739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:36.580381Z","title":"Ov-mer: Towards open-vocabulary multi- modal emotion recognition","venue":null,"work_id":"bd93c892-ca3c-495b-bbff-1108fd01c2e3","year":2025},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:30.544722Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:8e9e2cdef411fd6e811a3658704ab3396b094bde918e829901fea2eb8befb6df","observation_id":"0b3c981a-614c-4c59-b32c-700f34dd850d","resolution":{"observed_at":"2026-08-06T12:18:36.718680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:36.361999Z","title":"Af- fectgpt: A new dataset, model, and benchmark for emotion understanding with multimodal large language models","venue":null,"work_id":"93571de6-963d-4000-9443-75b109967480","year":2025},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:30.634240Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:6f1a7dafd6ba3e5fdb155cb2cfd760971642bf13360f46e6f254350152a5d709","observation_id":"4645c05e-13d6-4053-a3ff-b54cca8f6139","resolution":{"observed_at":"2026-08-06T12:18:36.453411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-08-10T09:42:17.185681Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17419","snapshot_observed_at":"2026-08-06T12:18:30.733821Z","title":"From sys- tem 1 to system 2: A survey of reasoning large language models.arXiv preprint arXiv:2502.17419, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:30.733821Z"},"links":{"cited_paper":"/paper/2502.17419","citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:67b96d8c3265b620e31eaf984096c453f2d6edfcde0b65a2b7d4e89fb40be180","observation_id":"5e7e6434-b61d-4182-b307-d66b066735de","resolution":{"observed_at":"2026-08-06T12:18:30.733821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-06T12:18:30.801571Z","title":"Visual-rft: Visual reinforcement fine-tuning.arXiv preprint arXiv:2503.01785, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:30.801571Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:6d7735e62195efdef36165248522998b8b999afb69050e2f03c7015bcd0c573f","observation_id":"ec32d509-c19c-43eb-a525-ecec7b3af040","resolution":{"observed_at":"2026-08-06T12:18:30.801571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11559","last_updated":"2022-11-18T18:50:09Z","snapshot_observed_at":"2026-08-05T09:04:05.570299Z","submitted_at":"2022-11-18T18:50:09Z","title":"Visual Programming: Compositional visual reasoning without training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11559","snapshot_observed_at":"2026-08-06T12:18:30.875408Z","title":"Visual programming: Compositional visual reasoning without training.arXiv preprint arXiv:2211.11559, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:30.875408Z"},"links":{"cited_paper":"/paper/2211.11559","citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:0980e7ea02d7cc56806e2322087b9d083c0e3c7ff1a0d4c99af55f3b0be63863","observation_id":"acbf79e9-a453-445c-81e2-2cf1ccce4be1","resolution":{"observed_at":"2026-08-06T12:18:30.875408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:36.060610Z","title":"Visual chain-of-thought prompting for knowledge- based visual reasoning","venue":null,"work_id":"a9765ea2-58e4-4813-8594-e8e9f21ace0a","year":2024},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:30.981852Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:43dca1e248e3c8d5b912a4b4fcfcaa42108560348853edd0f41a98bcaf6fadad","observation_id":"d07a0b31-6cee-4585-ba9b-6525e8515787","resolution":{"observed_at":"2026-08-06T12:18:36.189511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13621","last_updated":"2026-04-11T12:20:15Z","snapshot_observed_at":"2026-08-03T03:53:17.677772Z","submitted_at":"2024-06-19T15:17:10Z","title":"LaMI: Augmenting Large Language Models via Late Multi-Image Fusion","version":2},"cited_work":{"arxiv_id":"2406.13621","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.13621","snapshot_observed_at":"2026-08-06T12:18:33.283868Z","title":"LaMI: Augmenting Large Language Models via Late Multi-Image Fusion","venue":"cs.CL","work_id":"1fe7f774-373d-4675-8d18-151541af1977","year":2024},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:31.138395Z"},"links":{"cited_paper":"/paper/2406.13621","citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:b66b64f950530dd2fbc50dda5a41434d0e972dce5b648b04d27ce5a18c8065bf","observation_id":"d99ad617-03b0-4534-a7ea-5f6a91e237b6","resolution":{"observed_at":"2026-08-06T12:18:33.354038Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:35.812775Z","title":"An explainable vision question answer model via diffusion chain-of-thought","venue":null,"work_id":"b5013e00-e0b2-472d-8455-a3b9675cab44","year":2024},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:31.263848Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:886a0d1c8cc78d0c6ba055abb1b9d1df55e722e98976054f94d7187124340e57","observation_id":"5f6af8b3-4203-4346-9353-5555f5361ecf","resolution":{"observed_at":"2026-08-06T12:18:35.886744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:35.535598Z","title":"The relation between valence and arousal in subjective experience.Psychological bulletin, 139(4):917, 2013","venue":null,"work_id":"c6e03380-5a18-4039-a543-4988f58da008","year":2013},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:31.418101Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:bbc0a5b8ec325e92f3be5e16870653662648c1b1f9c2266690e642def3d6791c","observation_id":"12e8b7a5-2f19-4031-b883-ac4889c056a2","resolution":{"observed_at":"2026-08-06T12:18:35.691694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:35.231634Z","title":"Arousal, valence, and mem- ory for detail.Memory, 12(2):237–247, 2004","venue":null,"work_id":"887e8b0c-c632-4866-90eb-be4058da2b1c","year":2004},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:31.562616Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:871278a0bdc902748cea446bdf8195e4b460349a9b76be7c630e53c13c4e3184","observation_id":"7ac25b27-2593-4994-b885-9b9f2105ae1d","resolution":{"observed_at":"2026-08-06T12:18:35.369149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:34.960017Z","title":"Facial action coding system.Environmental Psychology & Nonverbal Behavior, 1978","venue":null,"work_id":"87b10e49-6060-4697-9208-b1581e2d31a7","year":1978},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:31.689631Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:b1ace325eaac67b200d05fdfcb0a49c7bfaa02a5be2ff7bf90fbb0828bed9867","observation_id":"d515ee12-2acc-4932-a8b1-c7eca222a843","resolution":{"observed_at":"2026-08-06T12:18:35.089526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T12:18:31.822763Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:31.822763Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:2954b4a5ef3dd0068643441bc32982af385a8b1734166275fea05e7a114da8ba","observation_id":"883dd76c-e4e3-45f0-9bf0-fd9b040bdf6b","resolution":{"observed_at":"2026-08-06T12:18:31.822763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-06T12:18:31.888109Z","title":"Representation learning with contrastive predictive coding.arXiv preprint arXiv:1807.03748, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:31.888109Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:2d6b08bedd843bba7129e9dcff80fce7a60977ce78422b745a83e4d392caae90","observation_id":"540bedeb-187a-448c-9dfc-dcadab01b2d4","resolution":{"observed_at":"2026-08-06T12:18:31.888109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:34.746884Z","title":"Balanced contrastive learning for long-tailed visual recognition","venue":null,"work_id":"cd15e1ec-9bf2-4652-be0b-da9b6edc7c52","year":2022},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:31.962363Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:245a263537cfc82bd5a4218b2978788bf00a514ea4b1d3367b5b5b3a0061844c","observation_id":"9a883165-e486-469f-bb15-7a22a935a461","resolution":{"observed_at":"2026-08-06T12:18:34.829391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:34.481920Z","title":"Mer 2024: Semi-supervised learning, noise robustness, and open-vocabulary multimodal emotion recognition","venue":null,"work_id":"e8af1bdb-b63e-436b-9a8d-fab9a7395cba","year":2024},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.057053Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:05535fa7d0cc3c1be0a7f0b64385872c394316623d8e842e40d8e1b0f62b53dd","observation_id":"361c99b7-16e4-41ab-86b2-ed2c3d85bde2","resolution":{"observed_at":"2026-08-06T12:18:34.614285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:34.186822Z","title":"Mer 2023: Multi-label learning, modality robustness, and semi-supervised learning","venue":null,"work_id":"010fe1c3-b97e-4b09-a83f-d2d84f3deaf6","year":2023},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.202923Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:f000099c7a9429560669fd17c426cd487c5c5c324945aa2dfbe62332c019eb07","observation_id":"c71cc0df-bb19-4809-950a-07bf92d0baa4","resolution":{"observed_at":"2026-08-06T12:18:34.325330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:34.008941Z","title":"Emotion-llama: Multimodal emotion recognition and reasoning with instruction tuning.Advances in Neural Information Processing Systems, 37:110805–110853, 2024","venue":null,"work_id":"f580f516-7fd4-4717-8cad-bf34871cdf24","year":2024},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.357879Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:8a4cb86b87e1f19f3ade4d62ddd190b9c8e9e5563f89823c4e954c6ee795f906","observation_id":"9d69c8ff-0d2c-4ea8-93f5-18dd6cb9654c","resolution":{"observed_at":"2026-08-06T12:18:34.070365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-06T12:18:32.448054Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.448054Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:f0e0ce847e07766ae5275055530bffa832ff336c312bf320a75d9e18d7e6198f","observation_id":"aa515d7c-71c5-416b-a031-6d593afef563","resolution":{"observed_at":"2026-08-06T12:18:32.448054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T12:18:32.553102Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.553102Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:fffb7c3a2dcde70a494e4ebb491975e84092ee30fb1f51f82110914bba1e72d6","observation_id":"7ef91280-3fa7-4007-aa6a-39f50dfe993e","resolution":{"observed_at":"2026-08-06T12:18:32.553102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-06T12:18:32.678085Z","title":"Minigpt-v2:Largelanguagemodelasaunifiedinterfaceforvision-language multi-task learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.678085Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:edb340b5d82b2c30f50ed8094a709667a0aaa33b27bdc7db1ec59e51055f0fbf","observation_id":"6c920637-e1db-4474-889f-be9987090f8c","resolution":{"observed_at":"2026-08-06T12:18:32.678085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-06T12:18:32.811352Z","title":"Video- llava: Learning united visual representation by alignment before projection.arXiv preprint arXiv:2311.10122, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.811352Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:c2270a7041dca00d9296849eb01e667bcac4719311fb60ae0ad7dbea16dc7311","observation_id":"9b8c1a8a-da01-478c-b1a1-083df0888033","resolution":{"observed_at":"2026-08-06T12:18:32.811352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-06T12:18:32.900270Z","title":"Video-llama: An instruction-tuned audio- visual language model for video understanding.arXiv preprint arXiv:2306.02858, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.900270Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:3c8f42ec158eedbf6e7b2424a8769c149176ac20982e0836627d10ab50cc8be7","observation_id":"1f53d9fd-8034-4b53-97fe-4a5538355a79","resolution":{"observed_at":"2026-08-06T12:18:32.900270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":2,"verified_fuzzy":17},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 2 inbound Pith citation observations for arXiv:2508.03722."}