{"as_of":"2026-08-18T13:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0cf860715031dbe68181b3db3e5cb6f33a591eea34891daeabafc975c0082537","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-23T00:21:51.621582Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:24:53.517329Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-21T06:03:59.353915Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09158","snapshot_observed_at":"2026-08-12T05:36:10.277122Z","title":"Favchat: Unlocking fine-grained facial video understanding with multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.00334","last_updated":"2025-08-31T12:40:53Z","snapshot_observed_at":"2026-08-17T23:20:02.902544Z","submitted_at":"2024-11-30T03:20:14Z","title":"EFTViT: Efficient Federated Training of Vision Transformers with Masked Images on Resource-Constrained Clients","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T05:36:10.277122Z"},"links":{"cited_paper":"/paper/2503.09158","citing_paper":"/paper/2412.00334"},"observation_digest":"sha256:4080c81ade376feed5aa2978bbb8153898ece27d0f24741291607ea8c8d68d5f","observation_id":"5ba5cb33-6382-473c-8040-56583ae8d228","resolution":{"observed_at":"2026-08-12T05:36:10.277122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09158","snapshot_observed_at":"2026-08-16T11:24:53.517329Z","title":"Favchat: Unlocking fine-grained facail video understanding with multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.517329Z"},"links":{"cited_paper":"/paper/2503.09158","citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:4d7d351accddc37a19e8c63bb2d99261768a025d19f3b28d6895986208c4672e","observation_id":"cbd471f6-cbb9-4ff3-a666-acbf55b4a1f4","resolution":{"observed_at":"2026-08-16T11:24:53.517329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09158","snapshot_observed_at":"2026-08-06T21:03:34.055384Z","title":"Favchat: Unlocking fine-grained facial video understanding with multimodal large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01254","last_updated":"2025-07-02T00:18:07Z","snapshot_observed_at":"2026-08-17T23:20:01.851952Z","submitted_at":"2025-07-02T00:18:07Z","title":"Robust Brain Tumor Segmentation with Incomplete MRI Modalities Using H\\\"older Divergence and Mutual Information-Enhanced Knowledge Transfer","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:03:34.055384Z"},"links":{"cited_paper":"/paper/2503.09158","citing_paper":"/paper/2507.01254"},"observation_digest":"sha256:f3e660d6bbbc1fe171c799fd1f63cd263620338baf11dc4f8a176e3eec09f1e8","observation_id":"4b85df83-b079-4313-8381-bdabb0b5a682","resolution":{"observed_at":"2026-08-06T21:03:34.055384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09158","snapshot_observed_at":"2026-08-06T17:48:16.921127Z","title":"Favchat: Unlocking fine-grained facial video understanding with multimodal large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09980","last_updated":"2025-07-14T06:55:32Z","snapshot_observed_at":"2026-08-17T23:20:01.439908Z","submitted_at":"2025-07-14T06:55:32Z","title":"Uncertainty Quantification for Incomplete Multi-View Data Using Divergence Measures","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:48:16.921127Z"},"links":{"cited_paper":"/paper/2503.09158","citing_paper":"/paper/2507.09980"},"observation_digest":"sha256:92cad74536521e04723c562a9641bd4311512db5ed88dbfb3468e4b1aa053191","observation_id":"5bf708bb-aadd-4262-9815-5ed15dfed5ce","resolution":{"observed_at":"2026-08-06T17:48:16.921127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"cited_work":{"arxiv_id":"2503.09158","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.09158","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","venue":"cs.CV","work_id":"56aab369-f3e4-4e9a-9cc0-d16081621994","year":2025},"citing_paper":{"arxiv_id":"2605.20606","last_updated":"2026-05-26T06:39:07Z","snapshot_observed_at":"2026-08-14T17:01:45.518731Z","submitted_at":"2026-05-20T01:49:39Z","title":"Mind Your Margin and Boundary: Are Your Distilled Datasets Truly Robust?","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-21T06:00:36.382942Z"},"links":{"cited_paper":"/paper/2503.09158","citing_paper":"/paper/2605.20606"},"observation_digest":"sha256:85b8e8522c179cd0d13b14203c89eda6da9c7c235ce190ab9e76719c5dde16da","observation_id":"2ef1deac-e59c-44f8-9962-3f0b3929dc36","resolution":{"observed_at":"2026-05-21T06:03:59.355420Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2503.09158/citation-record","integrity":"/paper/2503.09158/integrity","json":"/paper/2503.09158/citation-record.json","paper":"/paper/2503.09158"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:bab6cd5f6d072c9f3b60ac2c48767bf995b39c403f2653e0676816d6e9329369","observation_id":"fe585dc7-9c0b-4d92-9e1e-a4bd2b0b919e","resolution":{"observed_at":"2026-05-23T00:22:18.787000Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.00185","last_updated":"2018-03-01T03:05:50Z","snapshot_observed_at":"2026-08-17T13:40:06.263760Z","submitted_at":"2018-03-01T03:05:50Z","title":"Facial Expression Recognition Based on Complexity Perception Classification Algorithm","version":1},"cited_work":{"arxiv_id":"1803.00185","doi":null,"metadata_source":"pith","pith_arxiv_id":"1803.00185","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Facial Expression Recognition Based on Complexity Perception Classification Algorithm","venue":"cs.CV","work_id":"fed4056c-b30c-40dc-9783-68d36cc60a7f","year":2018},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"cited_paper":"/paper/1803.00185","citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:79439216ecfa94d87445071e9fc433f61bcef7209175bccc5d9cdc9778ef8ccd","observation_id":"01f34696-6116-44fc-b16b-5baddfcc56ba","resolution":{"observed_at":"2026-05-23T00:22:18.712213Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":"2406.07476","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-07-04T16:49:57.279303Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","venue":"cs.CV","work_id":"ccfc3f89-c510-45f1-8a35-ed1a56c0ae5c","year":2024},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:d4cd182566a05dfa595c40e8d6a66ff7801a1ef6d45b4490a891100b2b9d17cc","observation_id":"5c1cbf82-e86f-49b6-920d-99ca1a3c9ce8","resolution":{"observed_at":"2026-05-23T00:22:18.766937Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.patcog.2024","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Angarano, M","venue":null,"work_id":"8b688e1e-fdc8-4bd8-9c67-89a30f4dcef9","year":2024},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:e9729e8edc182100056f65709f26ab71ec455e30b569e388730b124d7f9f5b28","observation_id":"df2f04e3-34b3-448a-8c61-554adf072c81","resolution":{"observed_at":"2026-05-23T00:22:17.987800Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":"2503.21776","doi":"10.48550/arxiv.2503.21776","metadata_source":"pith","pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","venue":"cs.CV","work_id":"0ce88332-564c-4361-8e2a-3850eb1ace9c","year":2025},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:f208016bb9f13311cb9784fe58e23958c955b1d69a80c046245e972a320edca6","observation_id":"ec353264-939f-40ef-af28-3dbbe126e10f","resolution":{"observed_at":"2026-05-23T00:22:18.777189Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-13T08:50:13.017456+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T08:50:13.017456+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:0af0a516023eb7a8b76dfc851355727d3d464fb169b5137ebd538c66980fa344","observation_id":"35165ca8-d2ec-4554-95ea-87583becc981","resolution":{"observed_at":"2026-05-23T00:22:18.727457Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:44717cae3930128b718fadb64bf2673fb001fcad8e8235e7c2fa4207df1fedaf","observation_id":"031df850-c284-4e32-9c2f-977d3e3fbaff","resolution":{"observed_at":"2026-05-23T00:22:18.707541Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:b4934b1071fee2ced332dc7a199a80dca10321d7fc00ee82d899a781757ac64e","observation_id":"37fcc567-e408-4830-b985-deb0766b5266","resolution":{"observed_at":"2026-05-23T00:22:18.751954Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":"2311.10122","doi":"10.48550/arxiv.2311.10122","metadata_source":"pith","pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","venue":"cs.CV","work_id":"e2121c51-a55e-476a-af81-7ba6970fe6cf","year":2023},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:36c723ca576a520b24c25360d8f8cac3cc1fdae04f03651ec3a214420b9c8efc","observation_id":"c71034fd-077f-4007-a757-d013681e7fcf","resolution":{"observed_at":"2026-05-23T00:22:18.702592Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":"2503.20783","doi":"10.48550/arxiv.2503.20783","metadata_source":"pith","pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","venue":"cs.LG","work_id":"ec354f3b-9484-4a0c-94c8-92d4d0260835","year":2025},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:173ba3fa5685780e21fff3729b1d2246fb29129284a529f02e529cae460ac53a","observation_id":"33b12091-0a6f-405e-be84-621e23c885c5","resolution":{"observed_at":"2026-05-23T00:22:18.782179Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-16T15:24:32.944943Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:c63faca72232d0482c0e6415a6e9f275554031dc5b5f44218b21f1b449673291","observation_id":"08271f24-be62-4741-8711-197e91098711","resolution":{"observed_at":"2026-05-23T00:22:18.746828Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08870","last_updated":"2025-03-03T17:58:12Z","snapshot_observed_at":"2026-08-17T01:53:27.304289Z","submitted_at":"2023-12-12T09:47:59Z","title":"Vista-LLaMA: Reducing Hallucination in Video Language Models via Equal Distance to Visual Tokens","version":2},"cited_work":{"arxiv_id":"2312.08870","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08870","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vista-llama: Reliable video narrator via equal distance to visual tokens","venue":null,"work_id":"59ce56c3-c7fe-4097-8dfb-d4149f0c7603","year":2023},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"cited_paper":"/paper/2312.08870","citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:4e7f153ad9c3e8ddcf85808047af6e26aae9c382d90cc2216e23b161bc236d78","observation_id":"e16ea5c9-ee3c-424d-bcab-23f5c894bfdb","resolution":{"observed_at":"2026-05-23T00:22:18.717816Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":"2306.05424","doi":"10.48550/arxiv.2306.05424","metadata_source":"pith","pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","venue":"cs.CV","work_id":"51f627f4-8fae-4882-a3e9-abdf932ef27b","year":2023},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:a79f49ce2358a6dbe86829c4cebc8a1b79ba6610ef419962ec7d536e8083bb57","observation_id":"a0c22fd6-777a-48b8-83ec-dab2df69cca1","resolution":{"observed_at":"2026-05-23T00:22:18.791564Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12960","last_updated":"2025-03-10T17:08:19Z","snapshot_observed_at":"2026-08-16T14:08:17.788021Z","submitted_at":"2024-03-19T17:58:04Z","title":"FaceXFormer: A Unified Transformer for Facial Analysis","version":3},"cited_work":{"arxiv_id":"2403.12960","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.12960","snapshot_observed_at":"2026-07-01T10:35:42.203305Z","title":"Narayan, V","venue":null,"work_id":"db90ffee-333b-4e39-96d5-05b94946a8b9","year":2024},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"cited_paper":"/paper/2403.12960","citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:40e0ab623d4575122334c6902bf2e31324e0753c546dd829d551d9eb9bacef1a","observation_id":"82c147ad-0894-4e09-8eb2-ebdd49fb9c34","resolution":{"observed_at":"2026-05-23T00:22:18.722641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2017.278123","doi":"10.1109/tpami.2017.2781233","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URL http://dx.doi","venue":"IEEE Transactions on Pattern Analysis and Machine Intelligence","work_id":"7c8e6595-6691-4167-9d7e-02ca4e2d161a","year":2019},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:e87641b43e5e9490224f24e51122e2f163e31938bb495f5ea459cb79354fb79e","observation_id":"ace2587e-ff42-4e1c-988c-9c93c362e5f8","resolution":{"observed_at":"2026-05-23T00:22:17.961958Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:11d778eee2fd9099b8e2fe2dde7d431441463ccae1683467c581bcea6a8ab79d","observation_id":"8ec07407-5619-4eba-ba08-fa301fe2e6b2","resolution":{"observed_at":"2026-05-23T00:22:18.732580Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning spatial-semantic relationship for fa- cial attribute recognition with limited labeled data","venue":null,"work_id":"ee2883b7-ebdd-49ac-8a53-5731aae3a84c","year":2021},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:7c6081ed3c8a8eeca31dfbdfae47ec255ee4f98fb199649e52e66b4377b80491","observation_id":"a676eda1-87d5-41c2-ab97-1b05723ab799","resolution":{"observed_at":"2026-05-23T00:22:19.159055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6437.2021","doi":"10.1109/cvpr46437.2021.00033","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Derf: Decomposed radiance fields","venue":null,"work_id":"7083a41e-5666-435b-ab26-c753f6490b9a","year":2021},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:6b0494e05f4fdd584be100bfb56b087dc2e457e02e328e1c2a039cc70dd488b7","observation_id":"ab87a8ac-6219-4190-9218-00def8e61e8e","resolution":{"observed_at":"2026-05-23T00:22:17.975675Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16355","last_updated":"2023-05-25T04:16:07Z","snapshot_observed_at":"2026-08-14T10:09:12.476133Z","submitted_at":"2023-05-25T04:16:07Z","title":"PandaGPT: One Model To Instruction-Follow Them All","version":1},"cited_work":{"arxiv_id":"2305.16355","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.16355","snapshot_observed_at":"2026-07-04T01:19:20.316187Z","title":"PandaGPT: One Model To Instruction-Follow Them All","venue":"cs.CL","work_id":"b3689b4d-65c2-45ae-84da-01b291742486","year":2023},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"cited_paper":"/paper/2305.16355","citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:dbbadf402f210275901848f5b5c340eb1f4eb71ac2ada25802d502132361ce3d","observation_id":"5209f0be-d3b3-4e84-81b6-6a7cf5332ef1","resolution":{"observed_at":"2026-05-23T00:22:18.737331Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20717","last_updated":"2024-10-28T04:19:32Z","snapshot_observed_at":"2026-08-17T13:00:32.428107Z","submitted_at":"2024-10-28T04:19:32Z","title":"Face-MLLM: A Large Face Perception Model","version":1},"cited_work":{"arxiv_id":"2410.20717","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20717","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Face- mllm: A large face perception model.arXiv preprint arXiv:2410.20717, 2024a","venue":null,"work_id":"9ff6cf92-4dca-4451-a650-4900f89b14ca","year":2020},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"cited_paper":"/paper/2410.20717","citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:5f32070edec332f9462345fd2c3ab946a00fed8ef41c28080195dce532e6154e","observation_id":"dc692f8b-f14b-4b5e-aed9-a7d7fff1ba22","resolution":{"observed_at":"2026-05-23T00:22:18.762476Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/tpami.2020","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards robust monocular depth estimation: Mixing datasets for zero-shot cross-dataset transfer","venue":null,"work_id":"faf5c19f-040d-491f-adeb-f4afa56480a8","year":2020},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:d1726c70360d435c0726b8d4ff96856869fe154e5f28a0fcce9425bf904e7c5d","observation_id":"f4f709c2-0101-40fc-85ee-23962ee50f9c","resolution":{"observed_at":"2026-05-23T00:22:17.982626Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-12T07:49:26.923035+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T07:49:26.923035+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"S., Guo, A., Oler, E., Wang, F., Anjum, A., Peters, H., Dizon, R., Sayeeda, Z., Tian, S., Lee, B","venue":null,"work_id":"3b3154bf-7bde-4007-8d99-55c2d681430f","year":2022},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:1b74fc1f135d4f82ca621f438845c9911c42fbc3b2ef50f6ab101052de4238d3","observation_id":"4ab522f9-680a-48bc-8d5b-65f4d8424b66","resolution":{"observed_at":"2026-05-23T00:22:19.166183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2011.599556","doi":"10.1109/cvpr.2011.5995566","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Face recognition in unconstrained videos with matched background similar- ity","venue":null,"work_id":"1297188f-94fb-480b-86a7-647cf05ed39d","year":2011},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:4b7aa678a54cf99726c066522f86d1918d06bf37f66230bcaa02905efa660ec6","observation_id":"f6f284ad-0e76-43fa-8955-5a921396271f","resolution":{"observed_at":"2026-05-23T00:22:17.933334Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":"2407.10671","doi":"10.18653/v1/2024.naacl-long.246","metadata_source":"pith","pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2 Technical Report","venue":"cs.CL","work_id":"a1857881-ab9b-4b80-9b5f-9ae4b5c2566d","year":2024},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:2bcb939139e2021e3be3f1c8c0873d3d16f50a0bc26b86551db56ad5b6b029f5","observation_id":"224e6e15-0cac-48e6-9fb1-bb45a87e95e1","resolution":{"observed_at":"2026-05-23T00:22:18.741868Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:1af3976d95611519f9cab9c303a1e8bde16b6dc08a966a9982cbbb3654da2e94","observation_id":"f2854fe9-85b8-4649-bfe8-acefb36cb00d","resolution":{"observed_at":"2026-05-23T00:22:18.757044Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":"2306.02858","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-07-04T16:29:57.761121Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","venue":"cs.CL","work_id":"555cf04a-49a7-44b8-9019-a83ce85ace95","year":2023},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:f8d4c6d854e789b8311f81a3199c59c41baa3a88791db38af85c29e5bd27a335","observation_id":"76b44318-c068-4173-8ce1-689b9f5c4482","resolution":{"observed_at":"2026-05-23T00:22:18.771685Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/lsp.2016","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"919ccbe7-4d62-432e-8690-ba23ca2a1352","year":2016},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:36f42157725277d72741df5d0ac44cb9b40e07c954d2f423bb248542b5701309","observation_id":"f3fef310-12ad-4acf-b251-e60ba94ac4d7","resolution":{"observed_at":"2026-05-23T00:22:17.954471Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07978","last_updated":"2025-01-14T09:52:56Z","snapshot_observed_at":"2026-08-16T13:55:24.379397Z","submitted_at":"2025-01-14T09:52:56Z","title":"Facial Dynamics in Video: Instruction Tuning for Improved Facial Expression Perception and Contextual Awareness","version":1},"cited_work":{"arxiv_id":"2501.07978","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.07978","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fa- cial dynamics in video: Instruction tuning for improved fa- cial expression perception and contextual awareness","venue":null,"work_id":"f0aef9b3-ec8d-4b60-981d-68951a751ecc","year":2025},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"cited_paper":"/paper/2501.07978","citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:17bd7caed74db255efcf38f825440d4561b967856b01c31b402d773e7c6310d5","observation_id":"9ba63ce5-3dbf-4d8c-90ca-ef657731fb73","resolution":{"observed_at":"2026-05-23T00:22:18.796437Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"General facial representation learning in a visual-linguistic manner","venue":null,"work_id":"b1980ac1-5756-4992-950e-066a828f6d1e","year":2022},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:321b5541764bda64bf9ba3a24083b804bf4d23dc3a9208202f0f805c703062c8","observation_id":"41469856-50ef-4e0d-9222-bc187d299f37","resolution":{"observed_at":"2026-05-23T00:22:19.169888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2688.2022","doi":"10.1109/cvpr52688.2022","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A ConvNet for the 2020s","venue":null,"work_id":"0a23d1b7-bd56-43cc-8a80-7c43ce994e1e","year":2022},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:b14312e40d53b5bdb9e55500061776add0dc1f81cab71b40426c1926961423db","observation_id":"a92a8058-ecf9-4e3a-ade1-13f2839953a8","resolution":{"observed_at":"2026-05-23T00:22:17.948617Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-12T17:19:41.038772+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T17:19:41.038772+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Related Works The rapid advancement of multimodal large language models (MLLMs) has spurred the emergence of Video-MLLMs","venue":null,"work_id":"4f11ffb7-bf1b-4c5a-b58b-4623044cdeff","year":2023},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:edcbfd65867899311a60e34e6f29b84bb2ec25a55f2d347d8f39b978f17e0b30","observation_id":"60bd7986-7a4d-4878-a98e-2d44974cc5e0","resolution":{"observed_at":"2026-05-23T00:22:19.185281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"However, these strategies often sacrifice fine-grained features particularly in domains with rich and intricate details such as human faces","venue":null,"work_id":"5d19be33-2ae9-4bfe-9bff-907b8121de65","year":2023},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:5c9f344034d0cd66970e45fc51750da5df9efbc7a656e031eda3141ea938ed6a","observation_id":"4e3d5f2f-3faa-4525-9618-2fc97b0b4ec7","resolution":{"observed_at":"2026-05-23T00:22:19.151277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Below is a more comprehensive discussion of related work","venue":null,"work_id":"c907f3dd-f668-4abd-8f42-e05ad8d3d567","year":2025},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:8eb25ac988fd36ab901de6d5a2a374a6757bbd8b9959eecc49fa27b93cadfafc","observation_id":"0ec96c55-2102-4150-9304-34cc1e4c89ab","resolution":{"observed_at":"2026-05-23T00:22:19.173681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ab6a9242-961e-41e1-b182-6e0098177d4a","year":2023},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:fa7c8443b362b5507f7222bf72a16474c611f09930cb4729a343bd4ea70b2f2f","observation_id":"900d9b40-7ecd-4861-9b87-32d6eea89963","resolution":{"observed_at":"2026-05-23T00:22:19.200007Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"However, treating videos merely as sequences of images overlooks the temporal characteristics of videos","venue":null,"work_id":"98795ab5-299d-49e7-a445-3904d8f9fa9d","year":2024},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:d6ecf8f56ebfcd7d1a46e903f257416f4e4f33b4f1cce3afdceec555222afd21","observation_id":"f85de838-d3a3-444c-b787-7c368ee82f14","resolution":{"observed_at":"2026-05-23T00:22:19.147497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hair\": \"red, curly","venue":null,"work_id":"ebc4d546-e312-4643-8ea1-cb2a6ce9000e","year":2016},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:3f75c5eadbde43f5ffe32fa056f1cb8bfc84128b3a5efa4930c248463aa1baa0","observation_id":"65f54d02-4e37-4d5f-836a-51a295e47335","resolution":{"observed_at":"2026-05-23T00:22:19.193964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cffbd872-22e0-4595-b53f-ebf4ac897368","year":2025},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:c64f5f1224d08f4f140a5d9708f50e3b09c147295a0a474f54fb940797ec4400","observation_id":"61ab8367-526f-42ad-9dc3-87df94d913b9","resolution":{"observed_at":"2026-05-23T00:22:19.196893Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"face-centric","venue":null,"work_id":"0a479a20-0098-4fc4-9f37-637a9f0eee45","year":2001},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:611abfc75c09e1437210f5eedd8300da6f86bcb9ba1bcfceda9a9e68e9c95de5","observation_id":"1a12a386-4d28-4cbc-9f45-8f2a0c8d1466","resolution":{"observed_at":"2026-05-23T00:22:19.162705Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"af777206-313b-4878-b1f3-c9fd49c7fb82","year":2022},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:8d8bba7a45708e5e6a217385714902df13ba6c042a06457c1ae0b0a1a7f4c087","observation_id":"c585fba6-a6dc-4a99-bba2-4bedce21c1e0","resolution":{"observed_at":"2026-05-23T00:22:19.190481Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Specifically, given the detailed video attributes of CelebV-HQ, we have incorporated all 35,666 video from CelebV-HQ","venue":null,"work_id":"0474d999-0dd3-4644-9e56-ffe87991e815","year":2023},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:e62687b06f60e2031f87f04242de01330f8a0bb4b43ac565b0ef184620e765ba","observation_id":"234d4352-c2d7-4657-8051-73745336ef7e","resolution":{"observed_at":"2026-05-23T00:22:19.154714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The raw video frames are down sample by 16 to obtain a shorter frame sequence","venue":null,"work_id":"96281df1-0d27-45db-878b-f523bc1a3818","year":2024},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:276bf9d1e8500cfc55606af9f5d8da70f5ad043ec6437b1effcdb78ec8ad0b9b","observation_id":"c4b58162-9a7a-4b86-88d0-a78dd4f2922d","resolution":{"observed_at":"2026-05-23T00:22:19.143773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"18 Preprint Table 7.Performance comparison on the DFEC (Zhao et al., 2025a) dataset for textual emotion analysis","venue":null,"work_id":"81cb48d0-242c-4e52-8178-db7f089f0fb7","year":2000},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:fa7d3289b134fa8a7eb2022bffacc885870d6500f54e2966321f455b8877aba9","observation_id":"1ea43f0b-2c7f-4d13-b40a-dded5998c360","resolution":{"observed_at":"2026-05-23T00:22:19.136351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The YouTube Faces dataset is well suited for this setting, as it contains multiple videos per person under diverse conditions","venue":null,"work_id":"db259eec-9f8b-4c6e-89ca-edf8c1e21ee9","year":2025},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:58bc7afba6abaccca4bc1063c645244b48fd091dedd9a2efc0759e210440a0ec","observation_id":"b5d4f88b-b0bc-433e-aece-485f3feba32f","resolution":{"observed_at":"2026-05-23T00:22:19.139948Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","latest_version":6,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":2,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":3,"verified_exact":22,"verified_fuzzy":11},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 5 inbound Pith citation observations for arXiv:2503.09158."}