{"as_of":"2026-08-18T13:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7eddd2ee05d48eb21589280e1dba994cabfa859b672a7abbc5a190f9ae6ec41f","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T02:44:17.432243Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.14256/citation-record","integrity":"/paper/2607.14256/integrity","json":"/paper/2607.14256/citation-record.json","paper":"/paper/2607.14256"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.29403","last_updated":"2026-04-06T09:33:13Z","snapshot_observed_at":"2026-08-04T08:33:45.534264Z","submitted_at":"2026-03-31T08:05:54Z","title":"Security in LLM-as-a-Judge: A Comprehensive SoK","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.29403","snapshot_observed_at":"2026-08-02T02:44:13.210092Z","title":"Security in llm-as-a-judge: A comprehensive sok.arXiv preprint arXiv:2603.29403, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:13.210092Z"},"links":{"cited_paper":"/paper/2603.29403","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:577050cff098350ccfab4ba7c773a215c6e213a893f9025989e597ab7a57989c","observation_id":"52876c55-4ea9-4615-bc02-c38753137410","resolution":{"observed_at":"2026-08-02T02:44:13.210092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:13.302235Z","title":"Reference-guided verdict: Llms-as-judges in automatic evaluation of free-form qa","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:13.302235Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:55e77e28ddc7532c162d4520ea89748d68d5ee733dbb23e679a5043420e64f7a","observation_id":"58511f56-6fb5-48e6-81c5-87a22d890e21","resolution":{"observed_at":"2026-08-02T02:44:13.302235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12371","last_updated":"2026-04-15T02:42:08Z","snapshot_observed_at":"2026-08-15T17:29:41.114584Z","submitted_at":"2026-04-14T06:59:27Z","title":"Reading Between the Pixels: Linking Text-Image Embedding Alignment to Typographic Attack Success on Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.12371","snapshot_observed_at":"2026-08-02T02:44:13.401198Z","title":"Reading between the pixels: Linking text-image embedding alignment to typographic attack success on vision-language models.arXiv preprint arXiv:2604.12371, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:13.401198Z"},"links":{"cited_paper":"/paper/2604.12371","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:6400f445d2ee8efe6f168a65714a8727d0625839c5fbb3a24523414c0ebdb489","observation_id":"25ec6ad5-7450-430d-8bc1-36f5a9a20c14","resolution":{"observed_at":"2026-08-02T02:44:13.401198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:13.549266Z","title":"Rethinking fine- tuning when scaling test-time compute: Limiting confidence improves mathematical reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:13.549266Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:7bc38e3f19de499634d365e0a4b83c06b24d7f49af0b106963bfa4d92db780b3","observation_id":"7c0bc200-52d7-411b-b170-f737ba754229","resolution":{"observed_at":"2026-08-02T02:44:13.549266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12616","last_updated":"2026-04-14T11:44:59Z","snapshot_observed_at":"2026-08-17T13:34:03.640960Z","submitted_at":"2026-04-14T11:44:59Z","title":"Every Picture Tells a Dangerous Story: Memory-Augmented Multi-Agent Jailbreak Attacks on VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.12616","snapshot_observed_at":"2026-08-02T02:44:13.644542Z","title":"Every picture tells a dangerous story: Memory-augmented multi-agent jailbreak attacks on vlms.arXiv preprint arXiv:2604.12616, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:13.644542Z"},"links":{"cited_paper":"/paper/2604.12616","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:26bd3401637773ab1105813cd284d588e5e65e5155211c9f52bcc8730da08ad1","observation_id":"d430814e-b2b2-4e82-9c3d-bf34a6ec2e5f","resolution":{"observed_at":"2026-08-02T02:44:13.644542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:13.742784Z","title":"The side effects of being smart: Safety risks in mllms’ multi-image reasoning.arXiv preprint arXiv:2601.14127, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:13.742784Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:1aa439a4fbbf5f263248fc3f6cb015ed94243e8a6aa8ba8f36fd41fc17567c58","observation_id":"4697ea5a-7ce8-48f8-a8cb-ac68ac45c49e","resolution":{"observed_at":"2026-08-02T02:44:13.742784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.12710","last_updated":"2026-05-18T06:50:41Z","snapshot_observed_at":"2026-08-16T18:42:09.532465Z","submitted_at":"2025-11-16T17:52:07Z","title":"Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.12710","snapshot_observed_at":"2026-08-02T02:44:13.880726Z","title":"Evolve the method, not the prompts: Evolutionary synthesis of jailbreak attacks on llms.arXiv preprint arXiv:2511.12710, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:13.880726Z"},"links":{"cited_paper":"/paper/2511.12710","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:aeb6cf4ec0594a08c2fc2924b0fb4f2a8ae1564804bea2d39276cf4fae6ae658","observation_id":"9550f4db-fcb5-44ca-aa70-6971f60b464a","resolution":{"observed_at":"2026-08-02T02:44:13.880726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:13.955654Z","title":"Jailbreaking llms & vlms: Mechanisms, evaluation, and unified defense.arXiv preprint arXiv:2601.03594, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:13.955654Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:19bcbeafbdbf887418b47aaae97fbdb6df17fb54b845720253f861be2eeec219","observation_id":"0e4b58c6-1b82-4790-b85a-10630cd29029","resolution":{"observed_at":"2026-08-02T02:44:13.955654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.28488","last_updated":"2026-08-01T20:26:23Z","snapshot_observed_at":"2026-08-10T21:12:19.705860Z","submitted_at":"2026-03-30T14:23:15Z","title":"Courtroom-Style Multi-Agent Debate with Progressive RAG and Role-Switching for Controversial Claim Verification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.28488","snapshot_observed_at":"2026-08-02T02:44:14.030820Z","title":"Courtroom-style multi-agent debate with progressive rag and role-switching for controversial claim verification.arXiv preprint arXiv:2603.28488, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:14.030820Z"},"links":{"cited_paper":"/paper/2603.28488","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:bd1057b6b2a3c2afa922f2bc19db29e40a2b7b60880c98a2dafb0eee0c78a865","observation_id":"756d73ff-2ec1-4636-81fd-ecb371ac8b24","resolution":{"observed_at":"2026-08-02T02:44:14.030820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:14.131820Z","title":"Improv- ing factuality and reasoning in language models through multiagent debate","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:14.131820Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:08dbaea8a09e58427c31a39d3ead0b46fbc3689a79714c8055793a2f52f54994","observation_id":"482ba05c-36e7-4bbd-96b1-5fffbe61dc7b","resolution":{"observed_at":"2026-08-02T02:44:14.131820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:14.201724Z","title":"Bad students make great teachers: Active learning accelerates large-scale visual understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:14.201724Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:cdb90a578b0508cac2c4ebbe0e6261812f3d4e36db33ea5b873542bdede4d81a","observation_id":"2d181dc7-b008-4baf-9ebb-65978dae824b","resolution":{"observed_at":"2026-08-02T02:44:14.201724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:14.292307Z","title":"Contextnav: Towards agentic multimodal in-context learning.arXiv preprint arXiv:2510.04560, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:14.292307Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:6dbb0b760bb0125e44b472ef39eb3f051690ec72e662ddb492f3df8490b2a1ef","observation_id":"15ff5940-23fc-4a59-830b-8f83a5e745a9","resolution":{"observed_at":"2026-08-02T02:44:14.292307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:14.406045Z","title":"Adversarial defense in vision-language models: An overview","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:14.406045Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:58d96478acd9b174759d1fe0357a72491f0ccbb9df070c634a9dd102ec3f13dd","observation_id":"41636004-8125-44d0-958a-94928a86f81f","resolution":{"observed_at":"2026-08-02T02:44:14.406045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-08-10T17:26:25.602784Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.23455","snapshot_observed_at":"2026-08-02T02:44:14.501395Z","title":"Detpo: In-context learning with multi-modal llms for few-shot object detection","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:14.501395Z"},"links":{"cited_paper":"/paper/2603.23455","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:23daabf120455477fb553965b8974fb0cdd715fda22a2bf0a0dc52c57d2a1cfc","observation_id":"64785b11-9b35-4244-b252-0f932846d848","resolution":{"observed_at":"2026-08-02T02:44:14.501395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:14.602511Z","title":"Debate, deliberate, decide (d3): A cost-aware adversarial framework for reliable and interpretable llm evaluation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:14.602511Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:3c7abdb4fa1b75c4f7c81458449ab2747e871c5192839a0726a8a90236ff6879","observation_id":"dd6e3a12-bcfc-4e2a-bc28-fdd9f16717ec","resolution":{"observed_at":"2026-08-02T02:44:14.602511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:14.693049Z","title":"Aetheria: A multimodal interpretable content safety framework based on multi-agent debate and collaboration.arXiv preprint arXiv:2512.02530, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:14.693049Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:568d4c01f7529181fdef61f7148e8829e7c99440010fc86bcac0bca7b3a02c15","observation_id":"ca22c62f-9c53-4427-ae90-2a3130017d0f","resolution":{"observed_at":"2026-08-02T02:44:14.693049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05113","last_updated":"2025-06-06T17:08:12Z","snapshot_observed_at":"2026-08-18T12:58:14.839534Z","submitted_at":"2024-06-07T17:44:32Z","title":"LlavaGuard: An Open VLM-based Framework for Safeguarding Vision Datasets and Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05113","snapshot_observed_at":"2026-08-02T02:44:14.769734Z","title":"Llavaguard: An open vlm-based framework for safeguarding vision datasets and models.arXiv preprint arXiv:2406.05113, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:14.769734Z"},"links":{"cited_paper":"/paper/2406.05113","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:1d50d95c67a798126cf887fdeca03bd885936d271c33ae2ae11d242bdee8d52e","observation_id":"13e9c64d-93e5-40cb-8bae-88ef7353e82a","resolution":{"observed_at":"2026-08-02T02:44:14.769734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09316","last_updated":"2025-02-13T13:30:54Z","snapshot_observed_at":"2026-08-11T22:34:35.974825Z","submitted_at":"2025-02-13T13:30:54Z","title":"A Judge-free LLM Open-ended Generation Benchmark Based on the Distributional Hypothesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09316","snapshot_observed_at":"2026-08-02T02:44:14.843081Z","title":"A judge-free llm open-ended generation benchmark based on the distributional hypothesis.arXiv preprint arXiv:2502.09316, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:14.843081Z"},"links":{"cited_paper":"/paper/2502.09316","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:58ce529356bda7c30da6b4b440480697759cf7ff1c417be15db65c14a4271091","observation_id":"d069afdb-8d62-4b5b-bf68-da6366714a31","resolution":{"observed_at":"2026-08-02T02:44:14.843081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.00899","last_updated":"2018-10-22T17:36:07Z","snapshot_observed_at":"2026-08-14T21:47:20.607853Z","submitted_at":"2018-05-02T16:27:32Z","title":"AI safety via debate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.00899","snapshot_observed_at":"2026-08-02T02:44:14.904515Z","title":"Ai safety via debate.arXiv preprint arXiv:1805.00899, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:14.904515Z"},"links":{"cited_paper":"/paper/1805.00899","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:8f71dd490d9e9ce4e0f1636a92b45e06706d9d55fa7f036bd07e3a6f61d41d04","observation_id":"a35ee8e3-d5dd-4d57-99ce-0c7df1dfd0e4","resolution":{"observed_at":"2026-08-02T02:44:14.904515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:14.990323Z","title":"Adversarial attacks on multimodal large language models: A comprehensive survey.arXiv preprint arXiv:2603.27918, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:14.990323Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:464f74da0d643e5bab0b8362b9df898167ce2eb7e669fb96a37b8bf7b3de9a81","observation_id":"91538c90-cdc5-4d1d-be9d-95236c6607c7","resolution":{"observed_at":"2026-08-02T02:44:14.990323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:15.074317Z","title":"Curriculum guided massive multi agent system solving for robust long horizon tasks.arXiv preprint arXiv:2512.08545, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:15.074317Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:0e171f4f33020172c9b2a11f9bb79e6e8107719e74d77db48dcb08c3c755c2a4","observation_id":"83e048fd-179d-4526-9624-52b5e4a6387b","resolution":{"observed_at":"2026-08-02T02:44:15.074317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:15.141754Z","title":"Evaluating nova 2.0 lite model under amazon’s frontier model safety framework.arXiv preprint arXiv:2601.19134, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:15.141754Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:ffe1554b6b24ce0ebbad42efa648e221be8d96a8a17ef70bea7b185eb09d70ad","observation_id":"ddf61226-84f2-4a8b-98c8-c4d3febcff2b","resolution":{"observed_at":"2026-08-02T02:44:15.141754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:15.193060Z","title":"Biasscope: Towards automated detection of bias in llm-as-a-judge evaluation.arXiv preprint arXiv:2602.09383, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:15.193060Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:2286ae2858dd61a2e0854af16dfc47e97026d6ffe3ba67e51332a52a5463b839","observation_id":"a5eae34c-4ea6-4f95-971b-48f20d8970f9","resolution":{"observed_at":"2026-08-02T02:44:15.193060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:15.275900Z","title":"T-map: Red-teaming llm agents with trajectory-aware evolutionary search.arXiv preprint arXiv:2603.22341, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:15.275900Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:b15a53306d265fb0b8648414495e6742dbe8ad9857d43241299e936ba755d43c","observation_id":"30ae7cc6-cf76-4203-828a-0d13922aa6b6","resolution":{"observed_at":"2026-08-02T02:44:15.275900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.23143","last_updated":"2026-05-13T02:16:49Z","snapshot_observed_at":"2026-08-15T03:38:14.188109Z","submitted_at":"2026-01-30T16:31:02Z","title":"THINKSAFE: Self-Generated Safety Alignment for Reasoning Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.23143","snapshot_observed_at":"2026-08-02T02:44:15.360226Z","title":"Thinksafe: Self-generated safety alignment for reasoning models.arXiv preprint arXiv:2601.23143, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:15.360226Z"},"links":{"cited_paper":"/paper/2601.23143","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:8e770b48fc98ac15743d8608c0ac0cfcfeb9fe617275f5f1bc56462cddb64d28","observation_id":"9137ca88-9e26-4c79-86cf-143d26060fda","resolution":{"observed_at":"2026-08-02T02:44:15.360226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:15.415061Z","title":"Holisafe: Holistic safety benchmarking and modeling for vision- language model.arXiv preprint arXiv:2506.04704, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:15.415061Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:9dac768915497467b7698348a0781b4ae335ac070849ea519a8399081306b3ed","observation_id":"923205e8-ed21-4f3d-8ddd-1697e24ec7a1","resolution":{"observed_at":"2026-08-02T02:44:15.415061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:15.502229Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:15.502229Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:9e0f91bc4da3a97986852b54b31d2f62b333defd11806d14a51d04cd9eeaf2b9","observation_id":"07572d23-b8af-4145-a2de-79170a537b03","resolution":{"observed_at":"2026-08-02T02:44:15.502229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:15.559113Z","title":"From generation to judg- ment: Opportunities and challenges of llm-as-a-judge","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:15.559113Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:31c23f48266471558a1361d2e5feacf67f58a91925ba43c7479deeb132c05281","observation_id":"9594631e-637b-42b6-9e7e-8911513f7531","resolution":{"observed_at":"2026-08-02T02:44:15.559113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22316","last_updated":"2026-02-03T11:44:29Z","snapshot_observed_at":"2026-08-17T13:09:20.886295Z","submitted_at":"2025-06-27T15:25:23Z","title":"Evaluating Scoring Bias in LLM-as-a-Judge","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.22316","snapshot_observed_at":"2026-08-02T02:44:15.637387Z","title":"Evaluating scoring bias in llm-as-a-judge.arXiv preprint arXiv:2506.22316, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:15.637387Z"},"links":{"cited_paper":"/paper/2506.22316","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:24de1d3e63937f440e4f3947540b1da926ae4e603471c78a5513b0c43677e22c","observation_id":"f808fac0-18f9-4a75-be1a-ba4060ee7ead","resolution":{"observed_at":"2026-08-02T02:44:15.637387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:15.711786Z","title":"Who judges the judge? llm jury-on-demand: Building trustworthy llm evaluation systems.arXiv preprint arXiv:2512.01786, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:15.711786Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:e4d9219f9ac30df552a0c90ee60e02746d41d5aa280dad41bcec0208f8f33bde","observation_id":"9d216852-3fe2-4f35-8201-37ac60540127","resolution":{"observed_at":"2026-08-02T02:44:15.711786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:15.789634Z","title":"Benchmark test-time scaling of general llm agents.arXiv preprint arXiv:2602.18998, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:15.789634Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:fc35674d62464d6fff67257c26b98885ea95d2c33145950f15f332c319f9f924","observation_id":"67fad8d2-9f74-4a5c-82a7-14a406e4c347","resolution":{"observed_at":"2026-08-02T02:44:15.789634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:15.871821Z","title":"Elhplan: Efficient long-horizon task planning for multi-agent collaboration.arXiv preprint arXiv:2509.24230, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:15.871821Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:3e16097e978e91d84d2a6b26671db08147490a3d1b49e90558560280c9328907","observation_id":"1df74600-1e78-46b9-8622-439d85ef6787","resolution":{"observed_at":"2026-08-02T02:44:15.871821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09731","last_updated":"2024-02-16T17:30:41Z","snapshot_observed_at":"2026-08-18T03:58:54.359631Z","submitted_at":"2023-11-16T10:02:40Z","title":"Examining LLMs' Uncertainty Expression Towards Questions Outside Parametric Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09731","snapshot_observed_at":"2026-08-02T02:44:15.960327Z","title":"Examining llms’ uncertainty expression towards questions outside parametric knowledge.arXiv preprint arXiv:2311.09731, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:15.960327Z"},"links":{"cited_paper":"/paper/2311.09731","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:2ef7c7a1a533f40fa9245ac97c0ab7fe614d0ab369cdabc7a2dc3fcbbc0c8235","observation_id":"8ab350e0-6b97-41c7-ab24-217c230c7269","resolution":{"observed_at":"2026-08-02T02:44:15.960327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.12997","last_updated":"2026-07-22T21:19:00Z","snapshot_observed_at":"2026-08-07T17:40:47.895215Z","submitted_at":"2025-11-17T05:38:50Z","title":"WebCoach: Self-Evolving Web Agents with Cross-Session Memory Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.12997","snapshot_observed_at":"2026-08-02T02:44:16.036683Z","title":"We- bcoach: Self-evolving web agents with cross-session memory guidance.arXiv preprint arXiv:2511.12997, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.036683Z"},"links":{"cited_paper":"/paper/2511.12997","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:c61f2b9679bd7103e2dfe3a4a871d97f4e7d8bb6eb0388b4e709554fe3823782","observation_id":"dd68d04f-a297-440d-af26-260c3a2cfa9d","resolution":{"observed_at":"2026-08-02T02:44:16.036683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:16.085510Z","title":"Mosaic: Modeling social ai for content dissemination and regulation in multi-agent simulations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.085510Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:ee515e3c912217be11b77dab47d6be6a74f7399cb5967b0774ce70563b8d7f52","observation_id":"7ce210d1-3829-4b1c-812a-83df63e4f122","resolution":{"observed_at":"2026-08-02T02:44:16.085510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:16.135485Z","title":"Mtmcs-bench: Evaluating contextual safety of multimodal large language models in multi-turn dialogues.arXiv preprint arXiv:2601.06757, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.135485Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:814f37e9c7a14e617942b6e64e90f791aaf66d90857b69c69024210e1c6d1d6f","observation_id":"5ab79f7c-a3bc-497f-8223-45b369e101bb","resolution":{"observed_at":"2026-08-02T02:44:16.135485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:16.185073Z","title":"Ai debate aids assessment of controversial claims.arXiv preprint arXiv:2506.02175, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.185073Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:c5bb949e1d4a514930161ad35b1f03dcad005da05c0ceed6773a543a6c7aacd3","observation_id":"531fa067-92e2-407c-a07f-12b8772125dc","resolution":{"observed_at":"2026-08-02T02:44:16.185073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13203","last_updated":"2025-08-23T02:09:57Z","snapshot_observed_at":"2026-08-18T07:13:18.963689Z","submitted_at":"2025-04-15T16:11:28Z","title":"X-Teaming: Multi-Turn Jailbreaks and Defenses with Adaptive Multi-Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13203","snapshot_observed_at":"2026-08-02T02:44:16.255412Z","title":"X-teaming: Multi-turn jailbreaks and defenses with adaptive multi-agents.arXiv preprint arXiv:2504.13203, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.255412Z"},"links":{"cited_paper":"/paper/2504.13203","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:c74322a1b1689a545bad101a26b2206febd11dbcc0a1dd1eadf99b7dfc783846","observation_id":"9236d518-02f5-4c78-86c7-a3e914e97b47","resolution":{"observed_at":"2026-08-02T02:44:16.255412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:16.307323Z","title":"Disc-amc: Token-and parameter-efficient discretized statistics in-context automatic modulation classification.arXiv preprint arXiv:2510.00316, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.307323Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:28237b99131500c1566f438b5c77ff5375290c36f1224d760fad7c05c9be74e4","observation_id":"ffb7c359-7219-48e5-bcf7-2e1325c7a3cd","resolution":{"observed_at":"2026-08-02T02:44:16.307323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.10002","last_updated":"2026-07-14T18:21:16Z","snapshot_observed_at":"2026-08-18T08:37:26.748862Z","submitted_at":"2025-10-11T04:06:07Z","title":"Interaction Protocol Shapes Moral Judgment in Multi-Agent Debate","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.10002","snapshot_observed_at":"2026-08-02T02:44:16.371761Z","title":"Deliberative dynamics and value alignment in llm debates.arXiv preprint arXiv:2510.10002, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.371761Z"},"links":{"cited_paper":"/paper/2510.10002","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:cf1a93536ab63de6eb8477cd4d129441eaedb02e3ba12e54e44b890401def9a6","observation_id":"7058828b-0ee1-4b46-a2c9-16c53fc97cb7","resolution":{"observed_at":"2026-08-02T02:44:16.371761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17830","last_updated":"2024-03-26T16:10:21Z","snapshot_observed_at":"2026-08-16T14:06:12.253576Z","submitted_at":"2024-03-26T16:10:21Z","title":"Assessment of Multimodal Large Language Models in Alignment with Human Values","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17830","snapshot_observed_at":"2026-08-02T02:44:16.420847Z","title":"Assessment of multimodal large language models in alignment with human values.arXiv preprint arXiv:2403.17830, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.420847Z"},"links":{"cited_paper":"/paper/2403.17830","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:5baa646c8d14a659c9d5412105d492c3ffeadca94d8ebdd99900a19a5d632780","observation_id":"95cefedf-3041-4473-b764-6c41c76f0066","resolution":{"observed_at":"2026-08-02T02:44:16.420847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:16.446615Z","title":"Llm-as-a-judge for time series explanations.arXiv preprint arXiv:2604.02118, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.446615Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:46c58e97ac96ff0a92e3c718bcaf745ea5a0305df6eb1170f5aa1adeef42fa21","observation_id":"b3ab628d-ad3d-427c-a6a4-17e7ae4e68e0","resolution":{"observed_at":"2026-08-02T02:44:16.446615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:16.513676Z","title":"Unigame: Turning a unified multimodal model into its own adversary.arXiv preprint arXiv:2511.19413, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.513676Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:4288f27cfee4188caa7ea66762ae702c13f96150d412038d0574ec1ab9a81c5e","observation_id":"120bdebe-f285-4bb1-bb70-5a21c75d58a0","resolution":{"observed_at":"2026-08-02T02:44:16.513676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:16.574250Z","title":"Supporting human raters with the detection of harmful content using large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.574250Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:1a51fcc513a1b3ebb7fc874e09552d18b70c71f5d3b2e00d5e7d5c720a6c38ca","observation_id":"b5435b84-4cfe-4289-a100-9e21c2b2aba3","resolution":{"observed_at":"2026-08-02T02:44:16.574250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:16.631763Z","title":"Automated concept discovery for llm-as-a-judge preference analysis.arXiv preprint arXiv:2603.03319, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.631763Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:eba1554a37c07fed26382601d8ad0cfa26b3b7fc5127a06fedf9e30446181cee","observation_id":"26823bb7-34c3-4c03-b006-82a95b9ab134","resolution":{"observed_at":"2026-08-02T02:44:16.631763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:16.691039Z","title":"Can llm agents really debate? a controlled study of multi-agent debate in logical reasoning.arXiv preprint arXiv:2511.07784, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.691039Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:dabc60d81c501554189234b27206f77cd9d8a80717af0586260accfa7fa787f6","observation_id":"ae09ccf1-033f-4661-b6d9-4cdeb3e18042","resolution":{"observed_at":"2026-08-02T02:44:16.691039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-15T05:18:44.328500Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.10287","snapshot_observed_at":"2026-08-02T02:44:16.755987Z","title":"Outsafe- bench: A benchmark for multimodal offensive content detection in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.755987Z"},"links":{"cited_paper":"/paper/2511.10287","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:a1e3cfcee4cfc95627065daa03f5611b262bb7cbd7634ec794e8b3205159e544","observation_id":"9921a8aa-53d0-4ed6-8c6d-f66a804b1077","resolution":{"observed_at":"2026-08-02T02:44:16.755987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:16.818828Z","title":"Llama-3.1-foundationai- securityllm-reasoning-8b technical report.arXiv preprint arXiv:2601.21051, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.818828Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:7222021c27166f5d69b9fe611c1901edf5ebd378db459dfab5447e11542fbed7","observation_id":"808993bb-8fe5-42ae-b424-758395746a7d","resolution":{"observed_at":"2026-08-02T02:44:16.818828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02994","last_updated":"2025-08-05T01:42:25Z","snapshot_observed_at":"2026-08-14T02:30:04.335913Z","submitted_at":"2025-08-05T01:42:25Z","title":"When AIs Judge AIs: The Rise of Agent-as-a-Judge Evaluation for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02994","snapshot_observed_at":"2026-08-02T02:44:16.888129Z","title":"When ais judge ais: The rise of agent-as-a-judge evaluation for llms.arXiv preprint arXiv:2508.02994, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.888129Z"},"links":{"cited_paper":"/paper/2508.02994","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:c75e2397099cc653180a5d36f9e0abbc68af977c387241491007672f6b837695","observation_id":"243d2632-a2f4-454d-a540-90894987e1cb","resolution":{"observed_at":"2026-08-02T02:44:16.888129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:16.956146Z","title":"Evolving contextual safety in multi-modal large language models via inference-time self-reflective memory.arXiv preprint arXiv:2603.15800, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.956146Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:af9b35f42f0a063eef87f9cb98022dc380ba47e0d5b22f46c55d2d9210475480","observation_id":"d7e7d1ef-c352-43da-8b8c-b317f6c69775","resolution":{"observed_at":"2026-08-02T02:44:16.956146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:17.016819Z","title":"Visual exclusivity attacks: Automatic multimodal red teaming via agentic planning.arXiv preprint arXiv:2603.20198, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:17.016819Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:b75957f6c2253e2c5eebd5e853425e9c55567bf8048462739163305be7da20db","observation_id":"91a72551-1176-4d1c-9b5d-d29132eb03b7","resolution":{"observed_at":"2026-08-02T02:44:17.016819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19148","last_updated":"2025-06-12T04:05:38Z","snapshot_observed_at":"2026-08-16T12:55:00.361487Z","submitted_at":"2025-02-26T14:07:37Z","title":"Amulet: ReAlignment During Test Time for Personalized Preference Adaptation of LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19148","snapshot_observed_at":"2026-08-02T02:44:17.054063Z","title":"Amulet: Realignment during test time for personalized preference adaptation of llms.arXiv preprint arXiv:2502.19148, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:17.054063Z"},"links":{"cited_paper":"/paper/2502.19148","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:c9f1d456ff39b51d8d8e83aafa282a96d708a7a6cb633f554a8b2bcf1f0679c7","observation_id":"b2f95ed4-09d2-4d0e-a9f8-f48b33a53814","resolution":{"observed_at":"2026-08-02T02:44:17.054063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:17.106150Z","title":"inhumane conditions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:17.106150Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:8e59584766f88fb3dd845b0c171d1a0397473e9d1e608d15064b69fa86eb92dc","observation_id":"bc460a0f-f52e-4af6-8b41-e9d10122f13f","resolution":{"observed_at":"2026-08-02T02:44:17.106150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:17.183685Z","title":"{policy_text}","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:17.183685Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:587fc90bcba1f535bab65815ffca16ada4866dbd4d96e1aa680810d093d58cd2","observation_id":"24c00459-75db-4a1e-8d9b-515db75a8ca2","resolution":{"observed_at":"2026-08-02T02:44:17.183685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:17.271516Z","title":"This synthesizes a complete context block explicitly documenting the distinct arguments for and against each candidate classification label","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:17.271516Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:a29659b6530a5478ef158524f06fc11ef07cebe3c02a1a22ca9ea828ba60aed2","observation_id":"4aaef1b5-e16b-45b9-b010-037a7d8986f6","resolution":{"observed_at":"2026-08-02T02:44:17.271516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:17.347594Z","title":"{policy_text}","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:17.347594Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:3851a3fd0d7fadacd8393d6411e0d46cff8c3eaf5eb3fa2df356825a3090f8fa","observation_id":"0af11b24-c32d-4db8-bc87-8fd0451384ff","resolution":{"observed_at":"2026-08-02T02:44:17.347594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:17.432243Z","title":"If any dissent continues even after the debate round, the system automatically categorizes the instance as a deadlock and escalates it to the Level II Jury Committee","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:17.432243Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:54c71d61e93ab53e9a8e0739b22b5d58672217f6c5c5adb599466cdc415ea18c","observation_id":"a4c2016a-a3d2-46bc-b8c6-7d70ce6315a9","resolution":{"observed_at":"2026-08-02T02:44:17.432243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-17T14:10:21.633073Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2607.14256."}