{"as_of":"2026-08-16T18:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:92cebc64527b4f50f0fc4c27d2915cf9fdd65b7afdcce13af9085d99fee23097","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:44:29.296392Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.18168/citation-record","integrity":"/paper/2505.18168/integrity","json":"/paper/2505.18168/citation-record.json","paper":"/paper/2505.18168"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:30.443351Z","title":"A comprehensive review of facial expression recognition techniques.Multimedia Systems, 29(1):73–103, 2023","venue":null,"work_id":"69e1bcb1-af17-47c0-9740-065f9ccf184c","year":2023},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:28.894066Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:3180735ddee9cda8a5ef80fcbe3f09909448d2c9a5cdeaea89c809422a593dae","observation_id":"fd585619-4881-4431-a9bd-fe730379ea18","resolution":{"observed_at":"2026-08-15T21:44:30.448939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:28.900814Z","title":"Llama 3 model card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:28.900814Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:f52e30b70f50f5d7d315ee5c20d1d807b1bf0400c77a0bf49ffe184b6a4c0ca4","observation_id":"f4c81d0c-efae-426b-84af-0d4c07a6e459","resolution":{"observed_at":"2026-08-15T21:44:28.900814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:28.909847Z","title":"Claude-3.5","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:28.909847Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:465c0bfa93eab94b22110aa7661cd66be4959e67a8a3ee1cc1529ce298de5708","observation_id":"f9b005ec-5505-41f0-9761-d91329bffaf0","resolution":{"observed_at":"2026-08-15T21:44:28.909847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-15T21:44:28.915865Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:28.915865Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:95115e8de376c491195f87faaac2e950b0643ff1c5ee38924d9c8cb4c4291c14","observation_id":"e518addc-9255-4a91-9ee1-bb992dda0440","resolution":{"observed_at":"2026-08-15T21:44:28.915865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:30.386001Z","title":"Video-based facial micro-expression analysis: A survey of datasets, features and algorithms.IEEE transactions on pattern analysis and machine intelligence, 44(9):5826–5846, 2021","venue":null,"work_id":"69971421-d2bb-4470-9b6d-dff218aecbf2","year":2021},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:28.923638Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:7e7b69fdd1dc1e24748b511955319273f12c72e43bcf8b1e8c435d5591af2c14","observation_id":"efa85399-bc12-401f-8eb7-10c7d6329949","resolution":{"observed_at":"2026-08-15T21:44:30.393790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:30.368155Z","title":"Knowledge-driven self-supervised representa- tion learning for facial action unit recognition","venue":null,"work_id":"a26083dd-1ccf-4502-a2ad-a7d444134d51","year":2022},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:28.932420Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:5ef2a139a3b09d5581867ee83b76d5510d356aa50a31f69061d420cb62631bd7","observation_id":"f1a0ea46-782d-486d-9fd2-3cc0bb322616","resolution":{"observed_at":"2026-08-15T21:44:30.373312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-15T21:44:28.941071Z","title":"Minigpt-v2: large language model as a unified interface for vision- language multi-task learning.arXiv preprint arXiv:2310.09478, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:28.941071Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:8318f5f4ed5ba9093fc1de2a3ea8bc8621fe3b150b9b764f245b37e15fc565fe","observation_id":"64dff31f-2c95-413c-bc29-a408f7a74e10","resolution":{"observed_at":"2026-08-15T21:44:28.941071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-15T21:44:28.948070Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:28.948070Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:423d6e43825456f62aaa2aa8dcb6cef76628c756b20da49b317a0c57e388bd25","observation_id":"6df65fbd-105c-42ed-bcb9-d5ad5940160a","resolution":{"observed_at":"2026-08-15T21:44:28.948070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11161","last_updated":"2024-11-02T02:30:50Z","snapshot_observed_at":"2026-08-16T13:42:28.870435Z","submitted_at":"2024-06-17T03:01:22Z","title":"Emotion-LLaMA: Multimodal Emotion Recognition and Reasoning with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11161","snapshot_observed_at":"2026-08-15T21:44:28.953395Z","title":"Emotion-llama: Multimodal emotion recognition and reasoning with instruction tuning.arXiv preprint arXiv:2406.11161, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:28.953395Z"},"links":{"cited_paper":"/paper/2406.11161","citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:89811adbcfd7e3b586b87b8851ed458e74954d34291b1eb1c5f1d39fd1efce8a","observation_id":"c113b1d2-cb90-4053-9e67-7f9642cd5069","resolution":{"observed_at":"2026-08-15T21:44:28.953395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:30.351975Z","title":"Knowledge augmented deep neural networks for joint facial expression and action unit recognition","venue":null,"work_id":"bcee1008-810c-4fe8-a476-ab125b8452a8","year":2020},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:28.959369Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:e01b8718078a55f19536bc710658fecda4a13aaf12677f48d8ddda593664179f","observation_id":"6480a781-f225-4d80-bd6a-e0962068275f","resolution":{"observed_at":"2026-08-15T21:44:30.357090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:30.332877Z","title":"Knowledge augmented deep neural networks for joint facial expression and action unit recognition.Advances in Neural Information Processing Systems, 33:14338–14349, 2020","venue":null,"work_id":"5361df4b-e3e1-47df-afad-a8a9ff86f8d0","year":2020},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:28.965617Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:e5646326651bc1a26466971d37160f7ef3e035805a85d07fbae1b40cd70e73ef","observation_id":"0b40f4f7-85c6-414f-93d8-9a224ae0e826","resolution":{"observed_at":"2026-08-15T21:44:30.338683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:30.314351Z","title":"Decomposition of uncertainty in bayesian deep learning for efficient and risk-sensitive learning","venue":null,"work_id":"83f35aab-f7cd-4091-824e-1bc30534e661","year":2018},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:28.971272Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:3a3a2bbb7993792e636bf4fa07eadb45d37b44b7e64c012f2c073edef2738f3a","observation_id":"70b427b1-5d35-4377-8650-259d7ecd28e4","resolution":{"observed_at":"2026-08-15T21:44:30.319853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:30.297088Z","title":"Consulting Psychologists Press, 1978","venue":null,"work_id":"8c7e2b4d-313e-427a-8b09-862d65ed6c71","year":1978},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:28.976805Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:f3545be0fdd754e24386df329d5c1b1515d6fcf1eaf4b64828c198387dd051ba","observation_id":"ad635b35-ec6a-4bfd-963f-c24dba3eaed2","resolution":{"observed_at":"2026-08-15T21:44:30.302560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:30.279035Z","title":"Universals and cultural differences in the judgments of facial expressions of emotion.Journal of personality and social psychology, 53(4):712, 1987","venue":null,"work_id":"c3519eea-13c2-4f33-bbe3-d7a25f2bcb15","year":1987},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:28.981797Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:ef42d684e2345646de6f9e4b97893911bc4808fd245a55af1c520cebfebb8627","observation_id":"e0164aa9-a2d8-4f3b-8ba0-e1a5767d1518","resolution":{"observed_at":"2026-08-15T21:44:30.284906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:30.262008Z","title":"Oxford University Press, USA, 1997","venue":null,"work_id":"209a7bda-935c-44ff-8aaf-b1de8448260a","year":1997},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:28.988199Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:3ac88a2694c0d7f38ecbd43a7f2be9d0c8bb7ecb792915130cafe3f3ee4350c2","observation_id":"75196822-5c1b-464b-9ded-20435cad4d14","resolution":{"observed_at":"2026-08-15T21:44:30.267463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:30.243372Z","title":"Selfme: Self-supervised motion learning for micro-expression recognition","venue":null,"work_id":"98c50647-e186-4023-924a-9d53d6592286","year":2023},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:28.995942Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:97696a2c5b26e26434ba354e86702e7532e00db41d07cfd1277c05e4c622f84b","observation_id":"14a49383-e8f3-456d-8012-77ed47e06e97","resolution":{"observed_at":"2026-08-15T21:44:30.249255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00304","last_updated":"2025-06-03T03:39:27Z","snapshot_observed_at":"2026-08-16T13:22:30.663027Z","submitted_at":"2024-08-31T00:00:50Z","title":"StimuVAR: Spatiotemporal Stimuli-aware Video Affective Reasoning with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00304","snapshot_observed_at":"2026-08-15T21:44:29.001846Z","title":"Stimuvar: Spatiotemporal stimuli-aware video affective reasoning with multi- modal large language models.arXiv preprint arXiv:2409.00304, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.001846Z"},"links":{"cited_paper":"/paper/2409.00304","citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:d544ab3fd53d8f4829fd46ddc9bea12b342a5d4501b040dc9373f42611f47438","observation_id":"3da9ee51-14c9-4a74-bb20-d6377e3075db","resolution":{"observed_at":"2026-08-15T21:44:29.001846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:30.219758Z","title":"Opera: Alleviating hallucination in multi-modal large language models via over-trust penalty and retrospection- allocation","venue":null,"work_id":"649fbeaa-fb50-45a6-989b-0bc763ada0db","year":2024},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.007507Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:36fd0b7dcc01db6a67c45253aeef34b4ce89b14e659075149715cbe6d86ea3d0","observation_id":"3a11e821-1bf5-4677-beb8-bdae00a73d9f","resolution":{"observed_at":"2026-08-15T21:44:30.225745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:30.196894Z","title":"Disentangling identity and pose for facial ex- pression recognition.IEEE Transactions on Affective Computing, 13(4):1868–1878, 2022","venue":null,"work_id":"a8cc4012-2514-43f5-85b1-3179a716df68","year":2022},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.013511Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:3504ee88f96579ccc4deb70ca274a82e974b74675b358613ad2cb6f104cc6876","observation_id":"57c4d9c6-abde-4ca6-a54f-8f3c02e4eb99","resolution":{"observed_at":"2026-08-15T21:44:30.205050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-15T21:44:29.020890Z","title":"Scaling laws for neural language models.arXiv preprint arXiv:2001.08361, 2020","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.020890Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:06a87c281ef39279a18beea0378645d57cadbf0b7db96c3697c16a3e3b2465ce","observation_id":"745b3899-9528-4f52-b83f-f36bb18e897b","resolution":{"observed_at":"2026-08-15T21:44:29.020890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:29.027335Z","title":"What uncertainties do we need in bayesian deep learning for computer vision?Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.027335Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:72d25d896d75973e778da8dd1273f272b8e48fe438d880d25109ab505bfa45ad","observation_id":"4dbe5b7c-5255-4780-858c-4b1e63e723ed","resolution":{"observed_at":"2026-08-15T21:44:29.027335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.04855","last_updated":"2019-09-25T22:45:18Z","snapshot_observed_at":"2026-08-16T02:40:10.831894Z","submitted_at":"2019-09-25T22:45:18Z","title":"Expression, Affect, Action Unit Recognition: Aff-Wild2, Multi-Task Learning and ArcFace","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.04855","snapshot_observed_at":"2026-08-15T21:44:29.032686Z","title":"Expression, affect, action unit recogni- tion: Aff-wild2, multi-task learning and arcface.arXiv preprint arXiv:1910.04855, 2019","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.032686Z"},"links":{"cited_paper":"/paper/1910.04855","citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:266ea4df1ac5fafcf105a36e1485761c13aebf7503f5183b70bc36b4ab388abf","observation_id":"14e3cbe0-f036-49c6-9812-b2f827fa4ebe","resolution":{"observed_at":"2026-08-15T21:44:29.032686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-15T21:44:29.038401Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.038401Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:0ba3f845025d96be036a75bed580166c99e443a4663ab08f8e6bb307e85e50c9","observation_id":"e131d91b-6d0a-42ba-9509-7a97a75e051a","resolution":{"observed_at":"2026-08-15T21:44:29.038401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-15T21:44:29.051757Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models.arXiv preprint arXiv:2407.07895, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.051757Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:4e490eafe09591ababb49ac1ac42a62e5c9417f199e94477d4a44946f5df6044","observation_id":"b9df44d5-067c-460b-a979-2be5b9b89ed7","resolution":{"observed_at":"2026-08-15T21:44:29.051757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:30.162745Z","title":"Deep facial expression recognition: A survey.IEEE transactions on affective computing, 13(3):1195–1215, 2020","venue":null,"work_id":"65109708-b585-4670-9050-56cc7a2433dc","year":2020},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.057474Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:97610a5d5eaefaf9d4a4df84e3a11c7e28067a68d132881d7784a8cfada3a963","observation_id":"f7e0f455-66ff-43f4-b495-efc396b13ea6","resolution":{"observed_at":"2026-08-15T21:44:30.168425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:29.062498Z","title":"Reliable crowdsourcing and deep locality-preserving learning for expression recognition in the wild","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.062498Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:fcdc966d697eac2a1fef149cd0395f827091312753573a3aefa09b065a77054f","observation_id":"fc6dc9f8-2aa3-4003-a90e-44dd3b59918c","resolution":{"observed_at":"2026-08-15T21:44:29.062498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07653","last_updated":"2024-07-10T13:34:14Z","snapshot_observed_at":"2026-08-16T13:35:26.041054Z","submitted_at":"2024-07-10T13:34:14Z","title":"AffectGPT: Dataset and Framework for Explainable Multimodal Emotion Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07653","snapshot_observed_at":"2026-08-15T21:44:29.077312Z","title":"Af- fectgpt: Dataset and framework for explainable multimodal emotion recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.077312Z"},"links":{"cited_paper":"/paper/2407.07653","citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:85bad16f29d93d0f3073436abfe9cee6d1230b2221a1cbb7889d07335df1beb8","observation_id":"9be963ef-447c-4508-bf1d-b1e0c7f15dce","resolution":{"observed_at":"2026-08-15T21:44:29.077312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:30.126645Z","title":"Gpt-4v with emotion: A zero-shot benchmark for generalized emotion recognition.Information Fusion, 108:102367, 2024","venue":null,"work_id":"192b79cc-a7b4-40ab-96f9-3a745cd57901","year":2024},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.084190Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:f024a153e4441c0fdedbd1a9f97282c0339f1d9cc8204a607cdfabfc26b81eb4","observation_id":"98a81cd0-be0a-462b-ab95-3b99c413f73b","resolution":{"observed_at":"2026-08-15T21:44:30.132961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-15T21:44:29.089156Z","title":"Video-llava: Learning united visual representation by alignment before projection.arXiv preprint arXiv:2311.10122, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.089156Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:1677b76cc99a0d51385a715cc1816e15021b3113c4cdf39ab3c68e3deeace1b0","observation_id":"a712980b-a266-4421-a2fc-2ed05ad21a9f","resolution":{"observed_at":"2026-08-15T21:44:29.089156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:30.108338Z","title":null,"venue":null,"work_id":"807dbe22-0cd0-434f-b6af-6a9bf16d5029","year":1951},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.094388Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:1fd9adb8f680a67eec8598f72d38ade9616a51ddce58f091177e24cf555a56f0","observation_id":"dbf13a1f-c0d8-4dbe-b698-d95295c02381","resolution":{"observed_at":"2026-08-15T21:44:30.113934Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:29.099555Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.099555Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:fd96af79dc05953abf27e0c94fe137a078b09aba1ea1ed69a303bff87124828c","observation_id":"51b2a338-d5b0-4a45-bdc6-eebed7f88f3c","resolution":{"observed_at":"2026-08-15T21:44:29.099555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:29.105455Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.105455Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:1c45894e17b4becf16c3acaa0a2f893f64fe6c1623b1b9fd77105d8d298ec959","observation_id":"e3975bf9-e31e-4837-b8cf-bd9194cfc3c3","resolution":{"observed_at":"2026-08-15T21:44:29.105455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:30.042339Z","title":"Facial expressions elicit multiplexed perceptions of emotion categories and dimensions.Current Biology, 32(1):200–209, 2022","venue":null,"work_id":"2c4d7291-b875-4f2e-b37d-8b496335fb6d","year":2022},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.113610Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:50e0e07dc53a4c71ec9ec6655f4d7920007bee354bb95f16babc3100e97d1b25","observation_id":"bcefcfd6-9b7b-433c-84e8-a4efc059aea2","resolution":{"observed_at":"2026-08-15T21:44:30.047620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:29.121054Z","title":"Mafw: A large-scale, multi-modal, compound affective database for dynamic facial expression recognition in the wild","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.121054Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:fb005fd7f6b00403d3f2f969e359fc1c0d672b0f7c5a4be6695c6d96f6d729fb","observation_id":"77c80aab-deea-4ab0-b651-fb41d2a2aedb","resolution":{"observed_at":"2026-08-15T21:44:29.121054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:30.012998Z","title":null,"venue":null,"work_id":"1f78054d-3d62-40e9-bcac-28235dc49d5f","year":2017},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.127122Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:0cb27f91b17ca49f80dff1b4b409d844b6a4c9f88676a24b6066828d547943dd","observation_id":"125f7e72-fa0f-4036-9d25-3013e45fa241","resolution":{"observed_at":"2026-08-15T21:44:30.018532Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:29.990160Z","title":"Disfa: A spontaneous facial action intensity database.IEEE Transactions on Affective Computing, 4(2):151–160, 2013","venue":null,"work_id":"545c6247-8836-4887-a2d2-1dee42036405","year":2013},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.136191Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:828cd53748594e1b02e0b0696ff5e595f4c55d94a745d5c577965c0d46853669","observation_id":"79a82334-a25c-44e0-b9bd-6e1dac34184c","resolution":{"observed_at":"2026-08-15T21:44:29.996354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:29.970407Z","title":"Affectnet: A database for facial expression, valence, and arousal computing in the wild.IEEE Transactions on Affective Computing, 10(1):18–31, 2017","venue":null,"work_id":"d8041441-8385-4f89-8e16-a7e903176ddf","year":2017},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.141926Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:636069a8988f1f72cbac47825c0c8d9a76f12f380073c677c87a5ed1ea13c933","observation_id":"8054be0b-be9f-4196-a4e4-dd3a699d5405","resolution":{"observed_at":"2026-08-15T21:44:29.976436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:29.949836Z","title":"Multi-label co- regularization for semi-supervised facial action unit recognition","venue":null,"work_id":"08de9d5b-ddb6-4a80-a70a-ff544337fea3","year":2019},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.146858Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:8e3a76498c6439e03e0b842f29b822508bf83f838531253f517a5865040f5928","observation_id":"979104c4-dc8e-4e2f-90d1-45aeafc68fa1","resolution":{"observed_at":"2026-08-15T21:44:29.955566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:29.152898Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.152898Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:97442b589744221130b667146777f5e396e5dac2b65b0d81ca4c6fe09d6bea59","observation_id":"5901f188-0ce3-4085-9712-84e3446d8ec2","resolution":{"observed_at":"2026-08-15T21:44:29.152898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:29.158753Z","title":"Hello gpt-4o","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.158753Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:389e3f9dbdd4a7abdf8f3b1f3b18ed9a02db2afaaf1d26b6d70b23e2d015fc6e","observation_id":"2eda21f1-d106-4c47-ab59-be000aac1d17","resolution":{"observed_at":"2026-08-15T21:44:29.158753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:29.902812Z","title":"A unified and interpretable emotion representation and expression generation","venue":null,"work_id":"3f8256d7-ce6a-456b-a6d9-74b671b65f79","year":2024},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.165525Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:8ce3f7fe6f956c7b7b9e4d38a1157a55bee5f96fdf63cd7a81676f6f7bd04b71","observation_id":"a10c2b5b-932d-419c-b748-35c1eab6f891","resolution":{"observed_at":"2026-08-15T21:44:29.908899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:29.178279Z","title":"A circumplex model of affect.Journal of personality and social psychology, 39(6):1161, 1980","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.178279Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:9d054bec884ab51de57f6a7025d841fc48e79a89eb24f93601a7e170ea015818","observation_id":"d5cd58f2-4a73-469d-982c-3bc941549031","resolution":{"observed_at":"2026-08-15T21:44:29.178279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:29.869233Z","title":"Uncertain graph neural networks for facial action unit detection.Proceedings of the AAAI Conference on Artificial Intelligence, 35(7):5993–6001, 2021","venue":null,"work_id":"deff8de9-cff4-4f8d-9a66-8da2543ad533","year":2021},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.187860Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:c64afcd0cc7b79731fbfb97b6d407eaab8ad13047167a45a0557f57bcbe8afe3","observation_id":"edb27f16-0e2b-4d94-a18e-edc32ab125a2","resolution":{"observed_at":"2026-08-15T21:44:29.875105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:29.848377Z","title":"Hybrid message passing with performance-driven structures for facial action unit detection","venue":null,"work_id":"1492984f-16db-4088-bbe5-2ba97c4f3974","year":2021},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.194648Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:c3da7cae0f6eb1e4e8257fa83b780cd7591eb735f00456a85d92035ca678378e","observation_id":"a8f47576-8091-4484-9c08-adbeb174d240","resolution":{"observed_at":"2026-08-15T21:44:29.854631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-15T21:44:29.199625Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.199625Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:febe2bdbb688c06c0a2a3fbfd62c45bf599d7eaecc0ff52daf40817c6846845f","observation_id":"d3416001-0052-425e-a3a4-23903835f89c","resolution":{"observed_at":"2026-08-15T21:44:29.199625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-15T21:44:29.207681Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.207681Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:2b6b6450620a0b2b2c5bc5649a5420b6836fc1f51c5c0b3fdccb3484a3426c86","observation_id":"3fe20492-2509-484f-9a1b-b6ab00c93242","resolution":{"observed_at":"2026-08-15T21:44:29.207681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T21:44:29.212990Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.212990Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:38c22dccf9abf0c44ecba98e2c62cf62603ed876a1ddc7cf0f00882f03a82326","observation_id":"3aae1250-6c06-48f5-b557-3bba229d829b","resolution":{"observed_at":"2026-08-15T21:44:29.212990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:29.825067Z","title":"Rethinking the learning paradigm for dynamic facial expression recognition","venue":null,"work_id":"40e1e49e-33e9-43ab-8ef5-78d0952f045f","year":2023},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.218238Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:44d6a83d3ab138548de5c1c59d46d4554f0f94b86814147f7ef100ad11e22737","observation_id":"0dd3b1f7-89e4-4717-a477-52605470f60e","resolution":{"observed_at":"2026-08-15T21:44:29.831395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-15T21:44:29.223723Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.223723Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:cf5f9371c57da70434cea676351f28269eafc687d2b89287d8cad19a847d6338","observation_id":"35934a95-d9e1-42a0-a6dc-1c0ce49d7288","resolution":{"observed_at":"2026-08-15T21:44:29.223723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-08-13T18:24:04.904767Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-15T21:44:29.233811Z","title":"Enhancing the reasoning ability of multimodal large language models via mixed preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.233811Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:8acd23dcfb85cd54b93a94c315d79bc3dd1dc6e21491a4180495c9dd574f3950","observation_id":"de36e934-6782-42fa-9aee-d879762dbda5","resolution":{"observed_at":"2026-08-15T21:44:29.233811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:29.240611Z","title":"Emovit: Revolutionizing emotion insights with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.240611Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:caae065ad4610842ff43e8f0565a7bd22bb282e315629b5e50bfac1a05649406","observation_id":"f76c93ae-0f6e-42bc-ae1f-c6ae17b41707","resolution":{"observed_at":"2026-08-15T21:44:29.240611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-16T18:57:50.930866Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-15T21:44:29.247106Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.247106Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:ef4e6e2eb1b2ca204e8f41c42dfdbca0fb7f2a83c2c4da5c16c79c2b92b47656","observation_id":"ad5c8d31-a12a-4c95-bd8f-62e135eaece9","resolution":{"observed_at":"2026-08-15T21:44:29.247106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:29.786717Z","title":"Robust emotion recognition in context debiasing","venue":null,"work_id":"649d9a55-7aa7-45d3-b2b0-af64f6a44bf2","year":2024},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.255486Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:687160096806f51978afbab46e2c122c084d7cba32cc69355d6393fcabe92f31","observation_id":"c69de7ab-bd21-4e78-969f-d0d6795b13a4","resolution":{"observed_at":"2026-08-15T21:44:29.793904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-15T21:44:29.262550Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.262550Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:2dad19e85ead8dd745d4a5557abe03256c06f9b57d2fff7af922e16a07ef36b0","observation_id":"492de562-dca7-4574-bf19-7a55fa8adf0d","resolution":{"observed_at":"2026-08-15T21:44:29.262550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:29.276459Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.276459Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:3441f25f74a5dcb7b505fd012c5d34eb308bfc031d89aaa2bea7a106c0b3b216","observation_id":"aebe6239-57eb-4344-ada0-bd843454f20a","resolution":{"observed_at":"2026-08-15T21:44:29.276459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:29.755398Z","title":"A high-resolution spontaneous 3d dynamic facial expression database","venue":null,"work_id":"8461b0a0-5255-4e0e-a9d7-e0e4439d50f0","year":2013},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.284777Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:051c074cf1050b979e3d09c0609ed1ac0ce32c94ac03039fc902cad0e70f3f68","observation_id":"c66b5d0a-dbb2-4932-9697-f7fb8ebd4415","resolution":{"observed_at":"2026-08-15T21:44:29.761442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:29.290214Z","title":"Bp4d-spontaneous: a high-resolution spontaneous 3d dynamic facial expression database.Image and Vision Computing, 32(10):692–706, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.290214Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:319336b45845ffa94468c4d99a1c4410abd5134fb757780739ed6ac495c92b0e","observation_id":"45d9dd06-f5d7-46be-809d-79e895bd6a15","resolution":{"observed_at":"2026-08-15T21:44:29.290214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:44:29.721942Z","title":"Khfa: Knowledge-driven hierarchical feature alignment framework for subject- invariant facial action unit detection.IEEE Transactions on Instrumentation and Measurement, 2024","venue":null,"work_id":"41fcb434-6eec-4693-adee-099950f665b9","year":2024},"citing_paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T21:44:29.296392Z"},"links":{"citing_paper":"/paper/2505.18168"},"observation_digest":"sha256:c4a7943b2e28565d501fbaf12e6fb67fbcde17a5800120d1daa3279da5964fce","observation_id":"d99c2338-975d-412d-81a8-97d9fad1dd0c","resolution":{"observed_at":"2026-08-15T21:44:29.730776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18168","last_updated":"2025-05-14T03:00:20Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T02:40:40.234376Z","submitted_at":"2025-05-14T03:00:20Z","title":"Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2505.18168."}